Scale AI — AI Evaluator / Data Labeler (Freelance)
Provided multi-criteria evaluation and annotation of AI-generated responses, including linguistic clarity, factual accuracy, harmlessness, and rubric adherence. Audited and refined high-volume contributor-submitted datasets to remove noise and support gold-standard model training. Contributed to model training efforts using RLHF by generating detailed justifications aligned to selected answers. • Evaluated multi-turn model outputs for quality and safety • Performed category classification and preference ranking across outputs • Provided guidance and clarified edge cases in annotation instructions • Supported onboarding for international contributor teams