AI Output Tester & Evaluator
Evaluated AI-generated outputs for quality, accuracy, tone, and policy compliance to support reliable model behavior. Built and executed prompt test cases to probe LLM edge cases and refine evaluation criteria. Reported observed degradation patterns and issues to inform targeted improvements.• Evaluated 800+ AI-generated outputs per month for quality and compliance. • Achieved 0% critical errors on final deliverables. • Built 50+ prompt test cases targeting LLM edge cases. • Identified 12 issues from degradation reporting to guide fine-tuning.