AI Data Annotator & Evaluator at DataForce (TransPerfect)
Evaluated and rated LLM-generated responses for accuracy, helpfulness, and safety to support model fine-tuning and frontier model improvement. Produced ranked judgments aligned to project guidelines while identifying failure points and potential bias. • Assessed response quality and safety per rubric-based instructions. • Performed instruction interpretation and guideline application for consistency. • Helped stress-test model boundaries via prompt engineering experiments. • Maintained high labeling quality scores across domains.