AI Training Data Specialist — Annotation & Labeling Infrastructure
Responsible for designing and labeling large instruction-response and preference datasets used in RLHF and SFT training runs for production LLMs. Built gold-standard output definitions, evaluation rubrics, and structured evaluation criteria to guide labeling quality across diverse task types. Performed multi-language annotation and validation, correcting cross-linguistic inconsistencies that could degrade multilingual model performance.• Designed annotation rubrics and gold-standard output definitions for instruction-response and preference data.• Created evaluation scenarios and task prompts to test reasoning under ambiguous and multi-step conditions.• Implemented robust data validation and testing to catch 200+ edge-case labeling failures before training.• Annotated and validated outputs across 12+ languages, improving multilingual consistency and quality.