Data Annotation Tech — AI Response Evaluator / Data Annotator
Designed evaluation rubrics to score and rank AI-generated responses across multiple LLMs using structured quality criteria. Evaluated model outputs to identify factual errors, reasoning gaps, ambiguity, and qualitative differences in response quality. Authored clear, evidence-based rationales justifying rankings and documenting rubric-based scoring decisions. • Rubric design for structured response quality scoring. • Identification of factual errors, reasoning gaps, and ambiguity. • Evidence-based rationale writing for model rankings. • Analysis of prompt types to surface systematic model weaknesses.