Medical AI Trainer & LLM Evaluator (Rubric-based medical response evaluation and rewriting)
Evaluated AI-generated medical answers using a structured rubric tailored to clinical safety and reasoning quality. Assessed factual accuracy, clinical logic, completeness of management/differential, red-flag recognition, and whether recommendations appropriately direct users to medical consultation. Rewrote low-quality responses into safer, clearer, and more medically accurate alternatives while checking for hallucinated references and unsupported certainty. • Medical question-answer evaluation and response ranking/rating • Identification of unsafe/overconfident advice, missing differentials, and missing disclaimers • Treatment-summary and clinical reasoning quality review • Benchmark validation via case-based orthopedic and spine scenarios