AI Data Annotator & Prompt Evaluator at Outlier AI (2022–Present)
Evaluated and ranked AI-generated responses for accuracy, coherence, instruction-following, and overall quality across multiple task categories. Applied rigorous quality checks to maintain accuracy rates consistently above platform benchmarks while handling complex multi-step prompts and responses. Identified edge cases and ambiguous outputs and provided structured feedback to improve annotation and evaluation guidelines. • Assessed writing, reasoning, and coding-related response quality • Performed factual research, mathematical reasoning, and creative writing evaluation • Flagged edge cases and ambiguous outputs for guideline refinement • Used Python-based scripts and internal tooling to manage annotation batches