Freelance AI Evaluator - Outlier.AI
Worked as a freelance AI evaluator to create domain-specific prompts for assessing the quality of frontier large language models. Focused on testing models for factual accuracy, safety, and logical reasoning under varied coding, math, and problem-solving scenarios. Required strong prompt engineering skills and a solid understanding of evaluation for reliability and model behavior in real-world tasks. • Engineered coding, math, and reasoning prompts for stress-testing LLMs • Evaluated responses for factual accuracy, safety, and logical coherence • Assessed model behavior across domain-specific and adversarial scenarios • Iterated prompt designs to improve evaluation coverage