AI Generalist — Trainer, Evaluator & Data Annotator (Outlier AI)
Evaluated and rated AI-generated outputs across domains such as finance, compliance, and governance, focusing on factual accuracy, reasoning quality, and response safety. Annotated and labeled complex datasets used to train and fine-tune large language models, supporting improvements in model reliability and output quality. Applied prompt engineering to stress-test model behavior by identifying edge cases, hallucinations, and alignment failures for use in RLHF pipelines. • Assessed AI responses for quality and safety • Contributed labeled training data for LLM improvement • Performed prompt-based robustness and failure analysis • Used domain expertise in AML/KYC to guide high-stakes evaluation