AI Prompt Engineering Consultant (Prompt + evaluation/quality labeling for GenAI outputs)
Designed and operationalised structured prompting and self-critique workflows to evaluate and improve LLM outputs in production GenAI systems. Used prompt regression testing and evaluation harnesses to maintain quality consistency across multiple frontier and open-weight models. Applied constraints and reasoning-chain prompting techniques to reduce hallucinations and improve factuality for fintech content generation. • Built LLMOps evaluation harnesses using self-reflection critique loops and prompt regression testing • Benchmarked model latency, cost, and accuracy to select optimal models per task • Reduced hallucination rates by ~40% and revision cycles by ~60% through evaluation-driven iteration • Ensured responsible, safety-aware governance in evaluation and prompt design