Data Labeling Specialist & Chatbot Evaluator (Remote AI Operations / Distributed Platform Contract)
Evaluated large-scale LLM and NLP outputs using structured scoring criteria to support model alignment and quality improvements. Performed comparative assessments and generated clear written rationales for RLHF workflows. • Scored model outputs for constraint adherence, factual accuracy, grammar, tone, and logical coherence. • Executed RLHF tasks with concise structured comparative justifications. • Designed edge-case prompts to test safety protocols, semantic reasoning boundaries, and instruction limits. • Audited and cross-verified dataset items to improve alignment pipeline reliability.