AI Data Trainer & Evaluator (Outlier.ai, Remote)
Evaluated and ranked AI-generated responses for quality, accuracy, and instruction-following across text, coding, and reasoning tasks in an LLM feedback workflow. Wrote and refined prompts to probe model capabilities and elicit weaknesses in edge cases. Provided detailed written feedback and justifications to support model alignment with human expectations. • Response ranking and quality scoring • Prompt writing and adversarial/edge-case testing • Written feedback with rating justifications • Multilingual evaluation for English and Yoruba content