Freelance AI Data Evaluator & Language Specialist (Generative AI A/B testing)
Evaluated generative AI outputs by running comparative A/B testing against strict user prompts and category-specific guidelines. Reviewed, scored, and validated English responses for linguistic accuracy, structural integrity, and natural phrasing. Documented edge cases and provided feedback to improve AI model safety, alignment, and contextual awareness. • Compared A/B text responses to determine guideline-compliant output quality. • Scored linguistic and structural adherence to prompt requirements. • Flagged misalignment with formatting and localized nuance guidelines. • Produced edge-case notes and feedback loops for technical teams.