AI Training & Language Evaluation Contributor — Mercor (Remote)
Evaluated model-generated content across multiple language pairs for linguistic accuracy, naturalness, and cultural appropriateness. Delivered structured, detailed feedback by flagging issues such as mistranslations, register mismatches, ambiguity, and culturally inappropriate output. Worked independently and asynchronously to provide consistent evaluations at scale on flexible schedules. • Reviewed AI-produced multilingual text outputs • Assessed quality dimensions: accuracy, naturalness, cultural fit • Identified and reported linguistic errors and inconsistencies • Produced repeatable feedback to support downstream improvements