AI Model Output Evaluation & Prompt-Response Quality Testing
Developed and tested a multi-provider AI assistant (JARVIS) that required evaluating LLM outputs for accuracy, structure, and consistency. Assessed model responses across providers including Mistral, Groq, and OpenRouter — identifying failures, prompt weaknesses, and incorrect outputs. Designed a strict JSON response schema and iteratively refined prompts to improve model reliability. Also designed an AI classification pipeline for a thyroid cancer recurrence prediction concept, requiring careful thinking around model accuracy and output quality in a high-stakes medical context.