LLM Training & Prompt Evaluator (Freelance/Contract)
Evaluated frontier LLM outputs by designing complex multi-turn prompts and testing logical and coding boundaries. Assessed responses for hallucinations, bias, and flawed reasoning across specialized domains while ensuring factual accuracy and safe structure. Audited AI-generated technical instructions and academic explanations for strict factual compliance and reliability. • Prompt design for multi-turn logical boundary testing • Hallucination and bias identification • Safety- and structure-focused response auditing • Evaluation of complex reasoning quality