中文文本分类与数据质量评估(课程实践项目)—文本标注体系设计与质检
在“中文文本分类与数据质量评估”课程实践中,主导设计4级文本分类标签体系与细粒度标注规则文档,并将规则落地到大规模标注数据生产流程中。完成对2.3万条原始中文文本的清洗与标准化,随后开展去重与数据质量评估以提升训练数据可用率。输出结构化训练数据集用于BERT微调,包含原文、标签、置信度、审核人及修订日志等字段。 • 标签体系:4级文本分类标签与细粒度标注规则 • 质量控制:双人交叉标注、抽样复核与争议样本归因看板 • 一致性评估:使用Krippendorff’s Alpha进行标注一致性分析与偏移诊断 • 数据交付:交付1.8万条人工校验样本的CSV结构化数据集