AI Evaluation Specialist, Independent Contractor
Performed LLM output evaluations across reasoning quality, factuality, instruction-following, safety, and conversational quality using rubrics and preference-based frameworks. Conducted comparative assessments of AI responses, including red-team-style tests to uncover weaknesses in reasoning and adherence. Developed and refined evaluation rubrics and quality frameworks to standardize model testing and multi-turn judgment. • Evaluated multi-turn conversations and structured outputs for domain-specific reasoning challenges • Designed complex synthetic scenarios requiring nuanced policy interpretation and quality discrimination • Applied safeguarding protocols within red-team testing intended for vulnerable populations • Assessed other evaluators’ processes and outputs across LLM test categories