在之前参与的一个智能客服系统升级项目中,我负责多模态数据标注,具体涵盖了文本、图像和语音三种类型,主要目的是提升AI在文字客服、证件识别和语音导航场景中的准确率。 文本方面,我标注了超过 6000 条真实用户对话。需要判断每条文本的意图(
在之前参与的一个智能客服系统升级项目中,我负责多模态数据标注,具体涵盖了文本、图像和语音三种类型,主要目的是提升AI在文字客服、证件识别和语音导航场景中的准确率。 文本方面,我标注了超过 6000 条真实用户对话。需要判断每条文本的意图(如“查询账单”“投诉”“修改密码”)、情绪极性,并严格划分槽位信息,比如把“我想把手机号改成138……”中的新旧号码、生效时间等关键实体框选出来。我同时参与了标注规范的修订,并补充了数十条判例,帮助团队将标注一致率从 87% 提升至 94%。 图像方面,我使用 LabelImg 和 CVAT 工具,对用户上传的身份证、营业执照和手写申请表单进行标注。主要工作是拉框定位姓名、住址、统一社会信用代码等区域,并对模糊、反光、遮挡等低质量图像进行分类标签标记。为了让 OCR 模型能识别异形字体,我专门整理了 200 多张手写潦草样本的逐字框选,交付后模型字符准确率提升了约 5 个百分点。 语音方面,我使用 Audacity 和内部标注平台,对近 50 小时的客服通话和用户语音指令进行转写与切分。除了将语音转成文字并严格对齐时间戳,我还需要标注非语言事件(如停顿、咳嗽、背景噪音),以及说话人的性别、方言口音、语速快慢。针对带口音的语音识别薄弱区,我筛选出 3000 条西南官话和粤语腔调片段进行专项标注,有效帮助声学模型做了针对性调优。