Medical AI Prompt Evaluation Project / Medical AI evaluation & training work
Evaluated AI-generated medical responses for accuracy, clarity, safety, and clinical relevance against evidence-based medical guidelines. Performed comparative assessments between model outputs and reference standards to identify gaps, errors, and unsafe content. Iteratively improved prompt quality and response reliability by refining evaluation criteria and repeating the assessment cycle. • Accuracy and safety evaluation of medical text outputs • Clarity and clinical relevance scoring against guidelines • Iterative prompt refinement based on evaluation results • Documentation of evaluation findings for quality assurance