AI Evaluation Specialist — Mercor Intelligence (Remote)
Evaluated outputs from advanced AI language models using structured analytical frameworks. Identified logical inconsistencies, reasoning flaws, and factual inaccuracies across model responses. Provided written feedback to improve model accuracy, coherence, and decision quality. • Reviewed model responses for quality and correctness. • Assessed reasoning and logic consistency. • Flagged factual errors and inaccuracies. • Delivered written improvement feedback to support model refinement.