Outlier | LLM Evaluation Specialist & AI Data Annotation
Worked as an LLM Evaluation Specialist performing human evaluation of AI-generated responses. Assessed response accuracy, reasoning quality, clarity, tone, completeness, and factual correctness against conversational and system guidelines. Produced annotated evaluation data highlighting strengths, weaknesses, and factual issues, including for multilingual outputs. • Rated LLM answers to user queries for correctness, reasoning quality, and guideline adherence. • Annotated strengths, weaknesses, and factual inaccuracies to generate training/evaluation data. • Evaluated multilingual responses (Ukrainian, Polish, Russian) for linguistic and cultural appropriateness. • Reviewed and processed multilingual sensitive or policy-restricted content for safety compliance.