AI Evaluator / IT Domain Expert (Remote)
Served as an AI Evaluator and IT Domain expert evaluating AI system outputs for grounding, hallucinations, and user intent alignment. Designed and executed multi-turn prompt assessments to test contextual reasoning and personalization across domains. Conducted high-volume side-by-side evaluations to improve ranking consistency and response quality while enforcing strict data hygiene compliance. • Built multi-turn prompt tests for contextual reasoning and personalization • Rated model outputs for grounding, hallucination risk, and intent alignment • Performed side-by-side (SxS) evaluation for ranking consistency • Maintained data hygiene compliance to prevent dataset contamination