Health Sciences Specialist at InvisibleAI (Part-time)
Evaluated and challenged advanced language model outputs on complex health science topics by checking reasoning, factuality, and consistency. Designed and documented clinical scenario-based tests to surface failure modes and provide structured feedback for improving model safety and reliability. Verified responses against clinical guidelines and peer-reviewed literature to assess logical soundness and alignment with established health frameworks. • Assessed model reasoning failures, factual inaccuracies, and logical inconsistencies • Produced reproducible error traces and failure-mode documentation • Refined prompt engineering and evaluation metrics to harden reasoning for patient safety • Assessed the quality of AI-generated training data for next-generation medical systems