AI Evaluation & Data Science Specialist | Freelance (Multiple Clients incl. Deloitte AI Lab)
Participated in RLHF workflows for LLMs by evaluating model financial responses, ranking candidate outputs, and providing detailed preference feedback to improve model alignment. Assessed hallucination risk and measured model performance using accuracy, precision, recall, and hallucination-rate metrics for financial AI tasks. Engineered and tested prompts to evaluate reasoning quality on accounting and analytical workloads. • Performed model response evaluation and preference ranking • Generated structured feedback for RLHF improvement • Built evaluation frameworks for finance-domain metrics • Tested prompts for reasoning alignment to accuracy requirements