AI Data Labeler & Response Evaluator, Outlier AI
Evaluated and ranked AI-generated responses using quality, coherence, relevance, and helpfulness criteria. Applied evolving guidelines to maintain consistent labeling across tasks and edge cases. Provided concise written rationales for ranking decisions to support large-scale model improvements. • Rated and preferred AI responses • Flagged ambiguous prompts and guideline conflicts • Documented edge cases for task design improvement • Contributed to QA for AI model iteration