For employers

Hire this AI Trainer

Sign in or create an account to invite AI Trainers to your job.

Invite to Job
K
Keyang L.

Keyang L.

AI Training Engineer | Data Labeling & Model Fine-Tuning

Andorra flag台北, Andorra

Key Skills

Software

No software listed

Top Subject Matter

Data Labeling & Model Fine-Tuning

Top Data Types

No data types listed

Top Task Types

No task types listed

Freelancer Overview

拥有1年AI训练与数据标注全流程实战经验,深度参与过[NLP/CV/多模态]领域[百万级]样本的标注体系搭建与模型调优。擅长将模糊的业务诉求拆解为颗粒度精细的标注手册,并引入一致性校验(Kappa系数)与主动学习采样,曾以仅占总量[20%]的高信息密度样本覆盖[90%]的长尾场景,将标注分歧率从[18%]压降至[4%]以内。在训练侧,熟练运用[LoRA微调/全参SFT],善于从Loss震荡与Bad Case中逆向反推数据噪声,通过模板规范化与格式正则过滤,使验证集EM分数获得[+7%]的绝对提升。主导过数据清洗Pipeline,涵盖去重、脱敏及质量评分,并设计动态课程学习策略,在标注预算缩减[30%]的前提下保持Benchmark成绩持平。我始终信奉“数据质量决定模型上限”,致力于以工程化迭代思维剔除数据毒性,让每一次参数更新都建立在最干净、最有代表性的信息之上。

Labeling Experience

我曾主导过一个电商智能客服意图识别项目的训练数据治理与模型调优闭环工作。项目初期,基线模型的F1值仅卡在0.72,尤其在“退货政策咨询”与“物流投诉”两类语义高度相近的意图上频繁误判。我紧急抽检了3,000条分歧样本,发现症结在于标注手册对

我曾主导过一个电商智能客服意图识别项目的训练数据治理与模型调优闭环工作。项目初期,基线模型的F1值仅卡在0.72,尤其在“退货政策咨询”与“物流投诉”两类语义高度相近的意图上频繁误判。我紧急抽检了3,000条分歧样本,发现症结在于标注手册对“商品破损但客户未明确要求退款”这类灰色边界场景的定义存在空窗,导致标注员间一致性(Kappa系数)不足0.65——这才是模型困惑的根源。 面对这一瓶颈,我没有急于扩充数据量,而是逆向拆解模型Bad Case,亲手制定了“边缘场景决策拓扑图”,将模糊规则显性化为16组if-else逻辑链,并组织标注团队进行了两轮校准考试与共识对齐。同时,我利用模型预测熵值编写了低质样本回流脚本,自动筛选置信度低于0.6的高争议数据,推送给资深标注员执行“一人复标+二审”重标流程。经过两周密集迭代,当将这批深度清洗后的数据重新注入模型进行LoRA微调,意图识别准确率跃升至91%,且对长尾口语化表达(如“东西烂了咋整”)的鲁棒性显著增强。 这次经历让我深刻领悟到:数据标注远非机械打标,而是一场通过逆向工程将人类认知边界显性化写入训练集的精细博弈。标注手册的颗粒度与动态纠错机制,往往直接决定了模型微调的性能天花板——算法工程师最大的价值,就是在数据进入GPU之前,就把噪音扼杀在标注员的笔尖下。

Not specified

Education

加利顿大学 计算机科学与技术 硕士

Degree not specified

Not specified
Not specified

Work History

C

Company not specified

主导[电商智能客服/自动驾驶感知]领域的[10+万条]数据标注规范制定与质量闭环。针对模型在[长尾场景/模糊边界]误判率高达[30%]的问题,我逆向拆解Bad Case,将模糊规则显性化为[16组]边缘决策拓扑图,并引入动态抽检 + 专家复

Location not specified
Not specified