AI Evaluation Contributor (Remote / Outlier-style AI evaluation platforms)
Served as an AI evaluation contributor on remote, outlier-style platforms using detailed project-specific guidelines and rubrics. Evaluated AI-generated responses for factuality, instruction following, reasoning quality, clarity, formatting, safety, and overall helpfulness while identifying errors and weak justifications. Produced rationales explaining why one response was stronger than another to support comparative scoring and quality assurance. • Compared multiple AI responses for accuracy, compliance, and quality. • Reviewed STEM reasoning, mathematical problem solving, and technical explanation outputs. • Performed image evaluation and LaTeX/Typst formatting checks within evaluation tasks. • Detected hallucinations, unsupported claims, calculation errors, vague reasoning, and guideline failures.