Freelance AI Evaluator & Prompt Engineer (Independent Contractor, Remote)
Freelance AI evaluator reviewing AI-generated responses for factual accuracy, logical consistency, completeness, and instruction-following across multiple platforms. Responsibilities included producing structured written feedback that flagged reasoning errors, unsupported conclusions, and tone mismatches for use in model improvement pipelines. The role also involved applying evaluation rubrics consistently across diverse task categories and documenting model failure modes via prompt sequencing experiments. • Evaluated 500+ AI outputs across Mindrift, Toloka, Prolific, and Appen • Wrote rubric-based assessments for accuracy, reasoning quality, and guideline adherence • Designed prompt sequences to probe behavior and compare outputs under instruction variants • Met all client deadlines consistently while working remotely