AI Trainer & Prompt Evaluator (Freelance/Contract)
Evaluated and scored LLM outputs using structured rubrics for tone, factual accuracy, instruction-following, formatting, helpfulness, coherence, harmlessness, and task alignment. Reviewed 500+ AI-generated text samples and provided a short rationale for each rating to support prompt iteration. Identified recurring failure patterns such as hallucinations, instruction drift, and tone mismatches, then documented annotated examples to improve output quality. • Scored multi-step prompt sequence outputs from GPT-4 and Claude • Maintained structured feedback logs and quality benchmarks • Tracked error categories and rewrite rationales across model versions • Built 20+ prompt templates for lead generation, summarisation, and data extraction tasks