AI Trainer - Tuozhu Technology Co., Ltd. (AI Trainer)
Built SFT datasets for large language models by defining multi-dimensional annotation specifications and generating high-quality multi-turn prompt/response training samples. Created safety-focused RLHF data using adversarial prompting to mitigate hallucinations and harmful outputs, backed by quantitative bad-case rate improvements. Implemented a dual-layer automated-plus-manual quality control pipeline using Python scripts to filter low-quality, duplicate, and malformed samples. • Produced 120,000+ training samples across chat, knowledge Q&A, writing, and code generation. • Designed adversarial prompts and safety RLHF data to reduce bad cases from 5.2% to 1.8%. • Increased first-pass dataset acceptance to 96% via automated screening and manual verification. • Improved inter-annotator agreement from 0.75 to 0.89 (Cohen's Kappa) through training and calibration.