AI & Code Quality Evaluator (Independent Consultant)
Serves as an expert evaluator for LLM-generated code, assessing correctness, architectural soundness, efficiency, and compliance with Python PEP 8. Designs nuanced multi-turn prompts and evaluates model reasoning through edge-case scenarios, debugging exercises, and mathematical logic tests. Produces structured critiques that isolate errors and improve output reliability for human-in-the-loop review and training use. • Vet and rank LLM code blocks for algorithmic and performance quality. • Author multi-turn prompt scenarios targeting reasoning and debugging behavior. • Perform fact-checking and logical/security fallacy isolation in model outputs. • Provide evaluation feedback suitable for training and alignment workflows.