Senior Data Annotation & Prompt Evaluation Specialist | Remotasks / Scale AI
Evaluated AI-generated responses at high volume and provided structured rubric-based feedback for model training. Applied multi-criteria quality frameworks (accuracy, coherence, helpfulness, safety) to rank outputs with strong inter-annotator agreement. Identified failure modes such as hallucinations, vague reasoning, and format non-compliance, informing prompt-engineering revisions. • Assessed 500+ AI responses per week across multiple NLP generation tasks • Ranked model outputs using accuracy/coherence/helpfulness/safety criteria • Wrote structured feedback for direct consumption by model trainers • Mentored junior annotators and supported quality improvements