AI Response Evaluation & Annotation Projects (Remote/Freelance)
Evaluated AI-generated responses for factual accuracy, reasoning quality, and adherence to instructions. Performed comparative response ranking by assessing usefulness, clarity, correctness, and consistency across multiple outputs. Identified issues such as hallucinations, inconsistencies, formatting defects, and incomplete reasoning. • Assessed prompt quality and instruction-following behavior • Conducted documentation and output review for quality assurance • Performed comparative ranking and quality validation tasks • Checked for consistency across technical and non-technical evaluation criteria