Senior AI Content Evaluator & Quality Assurance Specialist (Welocalize)
Led qualitative evaluation and grading of complex multi-turn AI-generated English text outputs against helpfulness, honesty, truthfulness, and safety criteria. Produced evidence-backed preference justifications to support iterative fine-tuning of frontier LLMs and drove down hallucination behavior via secondary research and validation. Performed adversarial red-teaming to surface edge cases, biases, and security vulnerabilities in generated text. • Helpfulness/honesty/truthfulness/safety scoring and qualitative rubrics • Evidence-backed model preference rationales for training loops • Adversarial testing (red-teaming) for failure modes • Hallucination and claim verification across regional datasets