AI Data Annotation & LLM Evaluation Specialist
Label Studio
Text
Evaluation/RatingIn this role, I worked on text-based AI training and data annotation tasks focused on improving the quality, accuracy, and reliability of AI-generated responses. I evaluated model outputs against detailed guidelines, checking for accuracy, helpfulness, relevance, clarity, tone, completeness, safety, and instruction compliance.
My responsibilities included reviewing prompts and AI responses, comparing multiple outputs, selecting the stronger response, rating response quality, classifying text, flagging problematic content, and identifying issues such as hallucinations, unsupported claims, vague reasoning, grammar problems, formatting errors, and failure to follow user instructions. I applied consistent judgment across high-volume review tasks while maintaining strong attention to detail and quality standards.
Key responsibilities included:
Evaluating AI-generated responses for accuracy, relevance, helpfulness, clarity, and tone
Comparing multiple model responses and selecting the best answer based on quality guidelines
Rating and ranking AI outputs for model improvement
Labeling, classifying, and categorizing text data according to project requirements
Identifying hallucinations, factual inconsistencies, incomplete answers, and unsupported claims
Reviewing prompts and responses for instruction-following and user intent alignment
Flagging unsafe, low-quality, irrelevant, repetitive, or unclear responses
Performing quality assurance across large volumes of text-based data
Applying annotation guidelines consistently across repetitive tasks
Using strong research, editing, and analytical skills to improve training data quality
This experience strengthened my ability to support AI model training through accurate annotation, careful evaluation, and high-quality data review.