Freelance AI Content Evaluator & Prompt Specialist
This role involved evaluating and ranking responses from large language models for accuracy, soundness, tone, and adherence to instructions. I developed nuanced prompts and produced structured critiques for RLHF annotation pipelines. I maintained an AI output rubric framework across 10 quality dimensions, which was shared with peers. • Evaluated LLM outputs for factual and logical quality. • Wrote structured critiques used in RLHF pipelines. • Created prompts for exposing AI weaknesses and safety vulnerabilities. • Used rubrics for comprehensive, multi-dimensional model assessment.