AI Data Trainer / AI Evaluator at Outlier AI (Remote, 2024–2025)
Evaluated AI-generated text responses for accuracy, reasoning quality, factual correctness, and adherence to project guidelines. Performed ranking and comparison tasks to support large language model performance improvements. Conducted quality assurance reviews to identify annotation inconsistencies and maintain reliable outputs. • Accuracy and factuality checks • Reasoning quality assessment • LLM response ranking and comparison • QA guideline compliance verification