Mercor — Generalist Expert
Designed and developed prompts to evaluate and stress-test advanced AI model capabilities across varied domains. Reviewed and scored model-generated responses using structured rubrics to provide consistent, reasoned quality assessments. Identified recurring weaknesses in outputs and flagged data inconsistencies to improve iterative model and dataset refinement. • Wrote 50+ prompts for varied-domain model capability testing • Rated 100+ responses using structured rubric criteria • Flagged ambiguities and annotation errors affecting dataset integrity • Provided actionable feedback for iterative improvements