AI模型测评&训练工程师(大模型版本迭代评估与性能测试)
负责大语言模型各迭代版本的灰度测评、能力评估与版本验收工作。搭建涵盖准确性、逻辑性、完整性、流畅度、安全性与实用性在内的多维评估体系,并覆盖全场景用例执行。独立编写测评用例、批量执行测试、统计指标差异并输出正式测评报告,累计输出90余份测评报告并跟进整改缺陷2000余项。• 设计并执行多维评估用例与测试批次 • 统计对比新旧版本性能差异并形成量化结论 • 识别并上报知识错误、推理漏洞与输出不稳定 • 跟进闭环整改并支撑十余次版本升级
Hire this AI Trainer
Sign in or create an account to invite AI Trainers to your job.
AI模型测评&训练工程师(AI数据标注与数据质检). Core strengths include Don't disclose. Education includes Bachelor of Science, China University of Petroleum (Beijing) (2020). AI-training focus includes data types such as Text and labeling workflows including Question Answering, Red Teaming, and RLHF.
负责大语言模型各迭代版本的灰度测评、能力评估与版本验收工作。搭建涵盖准确性、逻辑性、完整性、流畅度、安全性与实用性在内的多维评估体系,并覆盖全场景用例执行。独立编写测评用例、批量执行测试、统计指标差异并输出正式测评报告,累计输出90余份测评报告并跟进整改缺陷2000余项。• 设计并执行多维评估用例与测试批次 • 统计对比新旧版本性能差异并形成量化结论 • 识别并上报知识错误、推理漏洞与输出不稳定 • 跟进闭环整改并支撑十余次版本升级
负责RLHF人类反馈与模型对齐优化,通过偏好对比与反馈标注帮助奖励模型与对齐策略迭代。熟悉奖励模型打分、偏好排序与PPO强化学习的基础流程,并将反馈聚焦于对话回复与知识问答等关键能力。累计完成3.5万+组模型对话偏好对比反馈,持续汇总共性缺陷并输出对齐优化文档支撑算法迭代。• 双人优劣对比、偏好打分与正负样本筛选 • 针对幻觉、逻辑错误、答非所问、冗余与态度偏差进行精准标注 • 汇总模型共性缺陷与能力短板形成交付材料 • 通过高质量人工偏好反馈提升回复逻辑性与准确性
在北京XX智能科技有限公司担任AI模型测评&训练工程师,负责大语言模型及多模态训练数据的标注与数据质检。对话问答、指令遵循、文本分类、逻辑推理与意图识别等场景进行全流程标注优化,并通过多轮复审提升数据一致性。累计完成12万+条高质量数据集标注优化,个人准确率稳定99%以上,修正错误及异常数据3000余条。• 建立初标-自检-交叉复审三级质检机制 • 进行清洗、校验、复审与异常样本过滤 • 迭代标注规范文档并统一团队标注口径 • 为预训练与微调迭代提供稳定、干净的数据支撑
负责大语言模型、多模态模型训练数据集的标注、清洗、校验、复审全流程工作,涵盖对话问答、指令遵循、文本分类、逻辑推理、意图识别等场景。严格按照项目标准执行规范化标注,建立初标、自检、交叉复审三级质检机制,过滤脏数据、噪声数据与歧义数据,保障训练数据集高质量输出。在职期间累计完成12万+条高质量数据集标注优化,个人标注准确率稳定在99%以上,修正错误及异常数据3000余条。参与迭代项目标注规范文档,统一团队标注口径,有效提升团队数据产出质量与合格率,为模型预训练和微调迭代提供稳定、干净的数据支撑。
Bachelor of Science, Computer Science and Technology
IT Operations Engineer (System & Network Maintenance)
Supply Chain Manager (Data & Operations)