I have worked as a freelance audio transcriber producing training data for AI speech systems
I have worked as a freelance audio transcriber producing training data for AI speech systems. My primary work involved transcribing natural Swahili and bilingual Swahili-English audio content including Kenyan Swahili, Kiswahili sanifu, and Sheng for YouTube and TikTok content creators. This required applying consistent annotation conventions for disfluencies, false starts, fillers, speaker turns, and non-speech events such as background noise and laughter, in both verbatim and clean-verbatim formats. I self-reviewed every submission against quality criteria before delivery and maintained session logs flagging ambiguous segments and audio quality issues. Additionally, through my final-year Computer Science project, I built structured data pipelines feeding two ML models an Isolation Forest anomaly detector and a Random Forest classifier giving me a working understanding of how labeling quality directly impacts model training outcomes