For employers

Hire this AI Trainer

Sign in or create an account to invite AI Trainers to your job.

Invite to Job
Y
Yang T.

Yang T.

Bilingual LLM Evaluation Specialist · Rubric Scoring & Pairwise Rating

China flagLos Angeles, China

Key Skills

Software

Data Annotation TechData Annotation Tech

Top Subject Matter

LLM evaluation and RLHF-style rating (rubric scoring, pairwise preference comparisons, rater QA) for multi-turn conversational and multilingual personalization scenarios
Bilingual Chinese/English content review and translation quality evaluation
E-commerce, FMCG, and consumer-marketing data analytics (KOL attribution, BI dashboards, business reviews)

Top Data Types

TextText

Top Task Types

Text GenerationText Generation
RLHFRLHF
Evaluation/RatingEvaluation/Rating

Freelancer Overview

Bilingual (Chinese/English) data labeling specialist with 3+ years of professional data analytics experience and active hands-on LLM evaluation work. Specializes in rubric-based scoring (8+ dimensions), pairwise preference comparison, multi-turn conversation rating, and bilingual rationale writing. Strong record on quality audits (R&R) — two-tier and three-tier — including editing rationales while preserving original voice. Comfortable with multilingual personalization testing on consumer LLMs and structured workflow tasks (debug-info extraction, HTML conversation export, UTF-8 file handling). Holds a Bachelor of Engineering (Communications, Yangtze University, 2022) and is completing a Master of Engineering in Software Engineering (East China Normal University, expected 2026).

Labeling Experience

Data Annotation Tech

DataAnnotation Tech — Data Labeling Specialist (LLM Evaluation & R&R)

Data Annotation TechData Annotation TechTextText

Billed as a DataAnnotation Tech independent contractor performing LLM output rating, comparison, and rater quality audits across multiple confidential projects. Conducted rubric adherence scoring, multi-model pairwise evaluation, and English rationale generation with translated Chinese evidence and formatting constraints. Delivered both initial ratings and R&R corrections using project-specific rules and evidence-based reasoning. •Rated multiple model responses to Chinese-language multi-turn prompts across 8+ rubric dimensions (including instruction following, completeness, factuality, fluency/localization, conciseness, and opener quality). •Ran head-to-head 4-response and 6-pairwise comparison workflows using tier-based logic and flagged items requiring expert knowledge or containing PII (CBR). •Audited other contributors’ submissions with binary (Good/Bad) and three-tier (Good/OK/Bad) schemes, flagging rubric violations such as fluff, inconsistency, factual errors, and contradictory pairwise choices. •Edited and rewrote rationales to fix format, spelling, missing evidence, and missing dimension links while preserving the original rater’s voice, tone, and required [Turn N] structure.

2025 - Present

Education

E

East China Normal University

Master of Engineering, Software Engineering

Master of Engineering
2023 - 2026
Y

Yangtze University

Bachelor of Engineering, Communications Engineering

Bachelor of Engineering
2016 - 2022

Work History

T

Tianlan Technology

Data Analyst

Shanghai
2024 - 2025
H

Huawei

Data Analyst

Shanghai
2022 - 2024