AI Content Trainer & Prompt Evaluation Specialist (Freelance, Remote)
Delivered prompt engineering for training and fine-tuning large language models focused on reasoning, factual accuracy, and contextual coherence. Applied RLHF-style preference ranking by comparing model outputs against quality criteria such as helpfulness, harmlessness, honesty, and instruction-following. Led red teaming to uncover vulnerabilities and safety risks and documented findings with reproducible test cases. • Developed and refined annotation guidelines and evaluation rubrics to improve inter-annotator agreement. • Evaluated AI outputs for factual correctness, logical consistency, tone appropriateness, and style adherence across client projects. • Collaborated with QA specialists and ML engineers to update labeling protocols and ensure dataset quality. • Mentored and onboarded new annotators, reducing ramp-up time.