AI-Powered Legal Guidance Platform — Hybrid AI model output evaluation (Independent Product Research)
Conducted structured evaluation of LLM outputs to assess accuracy, reasoning depth, and task fit for an AI routing stack. Compared GPT-4o mini versus Claude Sonnet across high-frequency versus complex query types to identify quality gaps and behavioural nuance. Used QA criteria, risk logs, and feedback cycles to ensure outputs met defined standards for downstream legal guidance content. • Assessed response quality using evaluation frameworks (accuracy, reasoning quality, alignment). • Tracked risks and blockers to maintain evaluation and delivery quality. • Produced documentation (QA plan, risk register) defining evaluation criteria and edge cases. • Enabled routing decision quality by feeding evaluation results into system behavior.