项目:电商客服意图分类标注 项目背景 某电商平台需要训练一个客服意图识别模型,要求将用户消息自动分为"退货退款""物流查询""商品咨询""投诉建议""闲聊"等 12 个意图类别,目标准确率 ≥ 92%。 我的角色 担任标注团队组长,负责标
项目:电商客服意图分类标注 项目背景 某电商平台需要训练一个客服意图识别模型,要求将用户消息自动分为"退货退款""物流查询""商品咨询""投诉建议""闲聊"等 12 个意图类别,目标准确率 ≥ 92%。 我的角色 担任标注团队组长,负责标注规范制定、质量抽检、一致性校准及 3 人标注小组的日常管理。 执行过程 阶段 关键动作 产出 规范制定 与算法工程师对齐意图边界,针对易混淆类别("仅退款" vs "退货退款"、"催单" vs "物流查询")编写判例手册,附 20+ 正负样例 《标注规范 v1.0》 试标注 3 名标注员对同一批 200 条数据进行双盲标注,计算 Fleiss' Kappa 一致性系数 初版 Kappa = 0.61(中等一致) 校准迭代 逐条复盘分歧样本,发现"用户同时抱怨商品质量并要求退款"这类复合意图是主要歧义源,修订规范为"取首要诉求",并增加优先级规则 第二轮 Kappa 提升至 0.83 正式标注 4 周内完成 15,000 条标注,每人日均 180 条,单人随机抽检比例 15% F1 抽检合格率 96.4% 质量兜底 建立困难样本升级机制——标注员遇到拿不准的样本标记为 uncertain,每周集中讨论定类 减少模型训练中的噪声标签 关键决策与难点 复合意图的标注策略:早期规范允许"多标签标注",但模型训练效果差,最终改为"单标签 + 首诉求优先",模型 F1 从 0.78 提升至 0.87。 标注员疲劳管理:连续标注超过 2 小时后错误率上升约 12%,我引入了每 90 分钟强制休息 15 分钟的节奏,并开发了快速自查脚本自动检测异常标注模式。 长尾类别的数据增强:部分类别(如"投诉建议")样本不足 3%,主动从历史客诉工单库中筛选补充,将最小类别占比拉升至 5.2%。 项目结果 最终交付标注数据集 17,200 条,整体标注一致性 Kappa = 0.86 模型上线后意图识别准确率 93.1%,超出目标 撰写的《标注规范》被复用于后续 3 个 NLP 标注项目