Senior AI Evaluation Specialist - Remote AI Projects
Led evaluation and optimization of large language model responses across multiple domains to maintain high accuracy and reliability. Built and refined prompt engineering approaches, including adversarial testing, to improve reasoning quality and safety performance. Produced enterprise-ready human feedback datasets and contributed to continuous quality assurance of AI outputs using data-driven evaluation methods and scripting skills. • Evaluated LLM responses at scale using quality scoring workflows • Performed prompt engineering and adversarial safety/risk testing • Curated and delivered human feedback datasets for enterprise AI systems • Applied QA and evaluation best practices to sustain top-tier quality metrics