AI Evaluation & Data Quality Specialist (Contract)
Evaluated and scored AI model outputs for truthfulness, accuracy, and quality using defined rubrics to produce structured human feedback. Conducted data quality reviews on multi-step task results, identifying hallucinations, factual errors, and rubric violations with traceable rationale. Applied human-in-the-loop evaluation frameworks to convert expert judgment into training and evaluation data. • Score AI outputs against rubric criteria • Flag hallucinations and rubric violations • Ensure traceable, detailed reasoning for feedback • Maintain scoring consistency across distributed evaluation batches