Senior AI Data Trainer & Evaluator (Freelance)
Performed RLHF evaluations by ranking and rating model responses to improve reward-model accuracy for LLM alignment tasks. Authored instruction-tuning prompt-response pairs across STEM, creative writing, code, and general knowledge domains. Conducted adversarial red-teaming of LLM outputs with qualitative feedback for jailbreaks, hallucinations, and policy violations. • Ranked and rated responses per provided guidelines and quality rubrics • Maintained 95%+ quality across high-volume annotation batches • Applied consistent decision criteria with project managers and guideline documents • Produced multilingual and domain-diverse datasets for alignment and safety use cases