AI Data Evaluator & QA Specialist — Outlier.ai (Remote)
Conducted RLHF-based evaluation of Large Language Model (LLM) responses using strict safety, accuracy, and relevance criteria. Assessed and refined prompt-to-output quality, including detection of issues that violate safety policies or contain factual/logical problems. Performed ongoing quality assurance work across a large set of complex tasks. • Evaluated LLM responses against safety and relevance guidelines • Maintained a 4.91/5.00 QA rating across 50+ complex tasks • Reported hallucinations, policy breaches, and logical inconsistencies • Performed prompt evaluation as part of the labeling workflow