AI Trainer — LLM Response Evaluation (Invisible AI)
Responsible for rubric-based evaluation of LLM responses across accuracy, relevance, clarity, and safety. Produced concise, well-reasoned justifications for each rating to support consistent model feedback. Conducted ranking and comparison across model outputs to generate human preference data for training and quality improvement. • Rubric-driven scoring and written justification • Ranking/comparison for human preference data • Safety and policy violation flagging with guideline adherence • Text labeling, search quality rating, audio transcription/segmentation, and translation/localization QA