AI Training Specialist, NovaMind AI (AI Training | Prompt Evaluation | Data Annotation)
Provided evaluation of LLM-generated responses for factual accuracy, reasoning quality, safety, tone, and compliance with complex project guidelines. Conducted pairwise ranking of model outputs and supplied detailed written explanations supporting decisions. Identified model weaknesses such as hallucinations, logical inconsistencies, bias, and unsafe outputs to improve training reliability. • Rated response quality across multiple criteria (accuracy, reasoning, safety, tone, compliance) • Performed pairwise comparisons with edge-case and rationale writeups • Flagged failure modes (hallucinations, bias, unsafe outputs) for remediation • Refined prompts and response examples used to improve instruction-following