Multi-modal Dataset Annotation for LLM & Computer Vision Training
This university laboratory project focuses on building high-quality training datasets for large language model SFT fine-tuning and computer vision model development. My core responsibilities include two major labeling tasks: first, annotate human-written instruction-response dialogue samples for LLM supervised training; second, draw bounding boxes for target objects on image datasets for CV model training. I have completed over 32,000 qualified annotated entries in total. Besides labeling work, I conduct raw data cleaning, deduplication and outlier filtering to optimize dataset quality, improving valid data proportion from 78% to 93%. I also perform regular sample quality inspection, summarize recurring labeling mistakes to revise annotation guidelines, and collect bad-case samples to feed back to algorithm teams to support model iteration and error reduction.