LLM & AI Model Evaluation
Conducted rigorous evaluation of large language models and deep learning systems during doctoral and postdoctoral research. Assessed AI-generated outputs for factual accuracy, reasoning quality, coherence, and safety. Developed structured evaluation frameworks and rubrics to score model performance. Identified hallucinations and logical gaps, then provided detailed feedback to improve model outputs. Authored technical reports and research papers documenting evaluation results and methodologies. Focused on high-quality assessment rather than large-scale annotation.