我曾深度参与一个千万级参数大模型的迭代优化项目,主要负责指令微调(Instruction Tuning)和伦理安全对齐阶段的数据生产与质量管控。 多维度的Prompt撰写与回复排序(RLHF): 我精通根据复杂的打分矩阵(如Helpful
我曾深度参与一个千万级参数大模型的迭代优化项目,主要负责指令微调(Instruction Tuning)和伦理安全对齐阶段的数据生产与质量管控。 多维度的Prompt撰写与回复排序(RLHF): 我精通根据复杂的打分矩阵(如Helpfulness, Honesty, Harmlessness)对模型生成的4-6个备选回复进行精细化的偏好排序。这不仅要求甄别事实性错误(Factual Error),更需要对潜在的风险偏见(Bias)和隐含毒性(Implicit Toxicity)保持高度敏感。 细粒度标注与思维链(CoT)解锁: 针对数学逻辑和复杂推理任务,我负责撰写详细的思维链(Chain-of-Thought)标签,将隐式的推理步骤显式化,以引导小参数模型进行有效学习。我在该项目中累计完成了超过2万条高质量CoT数据的标注,显著提升了模型在GSM-8K数学基准上的准确率。 标注体系搭建与质控(QA): 我曾担任标注小组的质检组长,主导制定了针对主观性文本的“边缘案例处理手册”。通过每日的校准会议(Calibration Meeting)和隐式一致性检查(利用黄金测试集测算Kappa值),我将团队的标注一致性(Agreement Rate)从最初的78%提升并稳定在92%以上,将无效标注的返工率降低了60%。 工具链应用: 熟练使用Labelbox、CVAT等主流标注平台,并具备编写简单的Python正则表达式进行预标签清洗(Pre-labeling)的能力,有效提升了原始数据清洗效率。