AI Evaluation Contributor (Freelance) | Remote/outlier.ai
Evaluated AI-generated text outputs to determine factual accuracy, relevance, and safety compliance against provided guidelines. Identified nuanced issues such as hallucinations and logical inconsistencies, then recorded findings for model improvement. Applied multi-tiered scoring rubrics to rate responses across creative, technical, and conversational categories. • Assessed tone compliance and guideline adherence for each model output • Documented hallucination instances and safety violations with actionable notes • Collaborated with cross-functional teams to refine training instructions based on patterns • Performed qualitative feedback to support improvement of LLM training datasets