AI Data Annotation & LLM Evaluation Specialist (Independent Contractor)
Evaluated AI responses across coding and general domains using task rubrics. Assessed correctness, instruction following, relevance, completeness, clarity, safety, formatting, and tone, and produced structured training signals such as preference rankings and rewrite suggestions. Performed multi-turn review to ensure consistent quality criteria while preserving user intent and context. • Coding task review for Python, JavaScript/TypeScript, and SQL • Rubric-based scoring and hallucination detection • Preference ranking, rewrite suggestions, and rationales • Multi-turn evaluation for ambiguous prompts