AI Data Annotation and Evaluation Practice (Academic/Self-directed) - Response evaluation and ranking
Evaluated Chinese and English AI responses for relevance, clarity, and instruction-following quality. Assessed helpfulness and factual consistency to ensure responses match expected standards and constraints. Used structured comparison workflows to identify differences between outputs for quality review. • Rated relevance, clarity, and helpfulness • Checked instruction-following and constraints • Verified factual consistency and correctness • Compared responses using ChatGPT for quality evaluation