Independent AI code review and prompt-response evaluation practice
Built structured practice workflows for evaluating model-generated code and prompt-response pairs in preparation for AI training and evaluation work. Reviewed outputs for correctness, edge cases, maintainability, dead code, safety boundaries, hallucination risk, and bilingual Chinese/English quality. Used rubric-based scoring, pairwise comparison, failure-mode checklists, and written rationales to produce training-data-ready evaluation notes.