AI Media Evaluator · Outlier AI
Evaluated AI-generated images, video, and audio across quality and correctness dimensions, including realism, factual accuracy, prompt adherence, and compositional consistency. Provided RLHF preference data and detailed annotation feedback to support iterative improvements in LLM behavior and multimodal output quality. Reviewed complex unstructured content such as multi-step conversations, threads, and documents to extract decisions, dependencies, and actionable insights. • Assessed HTML widgets and written responses against rubrics for helpfulness, instruction-following, formatting, and style. • Synthesized fragmented information into concise evaluation rubrics and task frameworks for assessing AI agent performance. • Identified systematic failure patterns such as visual artifacts, hallucinations, and tonal inconsistencies for targeted model refinement. • Maintained strict confidentiality when handling sensitive evaluation material.