AI Data Specialist, Project Diamond (Remote)
Evaluated and annotated generative LLM outputs to improve downstream accuracy, safety, and helpfulness. Applied logical-consistency checks, tone assessment, and bias reduction analysis according to project-specific instructions. • LLM response evaluation and annotation for logical consistency • Hallucination trigger identification and documentation via prompt variations • Structured metric creation from ambiguous user queries • Alignment to evolving helpfulness and safety rating guidelines