Independent AI Data Contributor & Tester | Self-Directed (2022 – Present)
Evaluated and annotated outputs from multiple large language models across domains including law, coding, science, and creative writing using structured quality rating criteria. Applied multi-criteria frameworks to classify and score responses for accuracy, coherence, safety, and helpfulness while maintaining consistent labeling standards at high volume. Identified hallucinations, factual errors, harmful content, and edge cases, documenting rationale and structured feedback for model improvement.• Labeled model responses using accuracy/coherence/safety/helpfulness rating rubrics. • Flagged ambiguous cases and provided detailed rationale notes for quality assurance. • Detected hallucinations, unsafe/harmful content, and other response quality issues. • Tested adversarial prompts and submitted structured feedback on model weaknesses.