AI training data standardization and preprocessing script development (annotation rule & quality verification)
The candidate has experience preparing and standardizing AI training datasets by implementing automated cleaning, deduplication, error correction, and format unification pipelines. The work includes formulating annotation rules and performing quality verification to improve label consistency and model training accuracy. The candidate also develops Python and C scripts to structure large-scale training data and establish standardized processing protocols. • Data cleaning, deduplication, and error correction workflows • Annotation rule formulation and quality verification • Automated batch processing and structuring of massive training datasets • Standardized protocols to mitigate dirty/invalid data impact