Data Preparation & Quality Assurance for ML Projects
Managed data preparation and quality assurance for 15+ machine learning projects across healthcare, education, and social media domains. Project scope included: - Cleaning raw datasets (handling missing values, removing duplicates, standardizing formats) - Data labeling for classification tasks (malignant/benign, survived/died, churn/no churn) - Feature engineering to improve model performance - Train/validation/test splitting with stratification - Quality assurance through cross-validation and error analysis Dataset sizes ranged from 500 to 50,000 rows. All work was performed with careful attention to data quality, consistency, and reproducibility. Projects are documented on GitHub with clear README files and code comments.