LLM Response Evaluation & Prompt Assessment
Conducted expert LLM response evaluation on sociology, humanities, and public policy prompts. Rated outputs for factual accuracy, reasoning quality, coherence, completeness, and instruction adherence. Compared multiple model responses using structured criteria to identify hallucinations and unsupported claims. • Authored 60+ evaluation tasks and rubrics for large language model assessment. • Performed structured evaluations across multiple quality dimensions. • Flagged logical inconsistencies and unsupported statements in generated text. • Delivered detailed human feedback to support dataset and evaluation quality improvements.