Large Model Professional Domain Data Construction (AI training data & evaluation/rating)
Created high-quality instruction datasets requiring multi-document context, user constraints, and attached artifacts (e.g., PDFs, configs, logs) to support supervised fine-tuning. Designed evaluation rubrics to score model outputs for factual accuracy, reasoning coherence, safety, and domain alignment, then used structured feedback to improve dataset standards. Performed corpus cleaning and deduplication to raise data quality for training and evaluation workflows. • Multi-document instruction dataset construction • Rubric design and structured feedback for labeling quality • Data cleaning and deduplication for SFT/classification pipelines • Validation of LLM outputs across factuality, reasoning, safety, and domain adherence