AI Trainer
Performed AI response evaluations by reviewing and annotating 100+ model-generated answers per week for technical correctness and factual accuracy. Provided structured, citation-backed feedback to guide iterative model training and reasoning improvements. Conducted prompt-based stress testing across GPT and Llama models to identify edge cases and inconsistencies that informed targeted updates. • Reviewed outputs and assigned correctness/fidelity feedback • Produced detailed corrections with reasoning notes • Calibrated evaluations using citation-backed references • Flagged failure modes discovered during prompt testing