AI Agent Evaluator (Freelance) - Outlier AI
Evaluated AI agent outputs for quality, correctness, instruction-following, and reasoning using structured evaluation criteria. Identified recurring failure modes and provided documented feedback to support downstream model training and fine-tuning processes. Contributed human feedback data consistent with RLHF-style quality improvement workflows and reviewed outputs across multiple task categories. • Quality and correctness evaluation of AI-generated outputs • Structured feedback documentation for model improvement • Category-based review and rating across tasks • Recording evaluation evidence to support RLHF-style workflows