AI Engineer—ThoughtScape (AI evaluation and reliability improvements)
Built and delivered end-to-end LLM application pipelines focusing on evaluation to improve model reliability in production. Implemented systems to detect hallucinations and optimize prompts based on assessment of output quality. Used evaluation results to reduce unreliable generations and improve consistency across live environments. • Hallucination detection via evaluation pipelines • Prompt optimization based on measured output reliability • Consistency improvements using production feedback loops • Reliability/scalability collaboration with stakeholders