For employers

Hire this AI Trainer

Sign in or create an account to invite AI Trainers to your job.

Invite to Job
X
Xiang Y.

Xiang Y.

LLM Training and QCKV Dataset Construction

China flagfujian, China

Key Skills

Software

Other

Top Subject Matter

LLM Training
Engineering Domain Question Answering
Multimodal Image and Video Annotation for AI Training

Top Data Types

TextText
ImageImage
DocumentDocument

Top Task Types

Fine-tuningFine-tuning
ClassificationClassification
Prompt + Response Writing (SFT)Prompt + Response Writing (SFT)

Freelancer Overview

LLM Training and QCKV Dataset Construction. Brings 9+ years of professional experience across complex professional workflows, research, and quality-focused execution. Core strengths include Internal, Proprietary Tooling, and Other. Education includes Master of Science, Tsinghua University (2023) and Bachelor of Engineering, Sichuan University (2021). AI-training focus includes data types such as Text, Image, and Document and labeling workflows including Fine-tuning, Classification, and Prompt + Response Writing (SFT).

Labeling Experience

LangChain-Based Multi-Agent System Data Annotation

OtherTextTextPrompt + Response Writing (SFT)Prompt + Response Writing (SFT)

I developed domain-specific training data for LangChain-based multi-agent systems, producing prompts and responses for intelligent material selection tasks in engineering. I designed task decomposition and reasoning workflows, integrating material property knowledge into structured annotation formats. I contributed to invention patents by annotating technical material selection processes. • Engineered prompts and annotated responses for AI agent development. • Integrated engineering material knowledge and reasoning workflows. • Provided high-quality, structured SFT data for multi-agent system fine-tuning. • Contributed labeled data to patented intelligent material selection systems.

2022 - Present

Multimodal Image and Video Annotation

OtherImageImageClassificationClassification

I conducted multimodal annotation work for images and videos, producing natural-language captions, structured annotations, and scene interpretation to train AI models. I focused on maintaining annotation consistency, semantic and visual accuracy, and precise alignment between visual content and textual descriptions. I reviewed and corrected multimodal annotation outputs to ensure high dataset quality for model training. • Labeled and captioned 10,000+ images and videos for multimodal AI. • Created structured annotations and visual descriptions in natural language. • Emphasized quality review and consistency checking in annotated data. • Supported downstream multimodal model training with high-quality labels.

2022 - Present

LLM Training and QCKV Dataset Construction

TextTextFine-tuningFine-tuning

I built hands-on large language model (LLM) training workflows based on Qwen2.5, implementing model architecture setup, training pipeline, data preparation, fine-tuning, and evaluation. I prepared structured QCKV datasets containing Question, Chain-of-Thought/reasoning process, Keywords, and Answer fields for use in supervised fine-tuning and domain-specific reasoning tasks. I cleaned, formatted, and reviewed instruction-style samples to ensure data quality and supported LLM tasks in technical question answering and simulation knowledge. • Hands-on LLM training and supervised fine-tuning using Qwen2.5 workflows. • Construction and labeling of structured QCKV datasets (Questions, Keywords, Reasoning chains, Answers). • Quality control through consistency review, formatting, and error correction for text data. • Engineering-domain data labeling for technical reasoning and simulation-based questions.

2022 - Present

Simulation and Engineering Data Processing for Annotation

OtherDocumentDocumentClassificationClassification

I processed and converted simulation and engineering documents from mechanical systems into structured datasets suitable for AI modeling and annotation. I handled data from Simulink models, fluid-structure-thermal coupling simulations, PINN surrogate modeling, and engineering-related documents. I ensured the transformation of complex domain knowledge into machine-readable formats for downstream AI training tasks. • Structured and annotated simulation data and engineering documents. • Mapped and classified information for training domain-specific AI models. • Bridged domain knowledge and training data preparation workflows. • Focused on accuracy in engineering data transformation and representation.

2021 - Present

Education

S

Sichuan University

Bachelor of Engineering, Mechanical Engineering

Bachelor of Engineering
2017 - 2021
T

Tsinghua University

Master of Science, Artificial Intelligence

Master of Science
2023

Work History

T

Tsinghua University

Research Engineer

Beijing
2021 - Present
S

Sichuan University

Mechanical Engineering Intern

Chengdu
2018 - 2021