Clinical AI / Medical LLM evaluation and validation via real-world cardiology case assessment
Evaluated medical LLMs using complex, real-world cardiology cases with multimodal inputs including imaging and physiological test results. Assessed AI outputs for clinical reasoning quality, safety concerns, and hallucination risk under ESC-guideline-based scenarios. • Performed evaluation of AI-generated ECG interpretation quality • Assessed AI-generated differential diagnoses against guideline-based reasoning • Conducted comparative benchmarking across AI systems for cardiology tasks • Implemented prompt engineering for complex cardiology scenarios