AI Evaluation Specialist (Freelance) at Prolific
Evaluated large-scale AI/LLM outputs for a FAANG-level client by assessing accuracy, coherence, and safety alignment. Identified weaknesses and edge cases by analyzing model responses across technical, conversational, and reasoning domains. Produced structured feedback and annotations to guide improvements in model performance and reliability. • Assessed response quality against accuracy and coherence criteria • Checked safety alignment and failure modes • Annotated issues and provided guidance for improvement • Ensured compliance with evaluation frameworks and throughput targets