AI / LLM Analyst
Evaluated AI model outputs across multiple modalities, including text, conversation, and document structures, with feedback directly supporting retraining cycles. Conducted both qualitative and quantitative assessment of model outputs, such as intent classification, sentiment analysis, safety guideline adherence, and factual verification. Curated high-quality training datasets, enforced annotation consistency, and performed 1,000+ bounding box annotation tasks on complex document layouts. • Processed preference ranking (RLHF) and model output evaluation for large language models. • Maintained 90–95%+ accuracy on 50+ daily labeling and evaluation tasks. • Participated in guideline reviews, calibration sessions, and error escalation for iterative improvement. • Collaborated with data scientists and engineering teams to refine annotation protocols.