AI Data Evaluator and Annotation Contractor (AI output quality review)
Evaluated 150+ AI-generated outputs for RLHF comparisons, content quality, and text evaluation tasks to assess response quality. Scored and checked LLM responses for correctness, relevance, coherence, and instruction-following, and flagged issues for escalation. Wrote structured rationales documenting the reasoning behind each rating decision. • Contract work via Remotasks (Scale AI) / Appen (remote) • Maintained a 96% average accuracy rating across high-volume evaluation batches • Used rubric-style assessment with compliance checks for every decision • Provided consistent quality control across multiple task formats