AI Text Evaluator & Data Annotator (Appen)
Provided multi-dimensional scoring of AI-generated text for accuracy, relevance, coherence, tone, and safety. Conducted RLHF pairwise preference comparisons by ranking two AI outputs side by side to generate human feedback training signals. Identified hallucinations, factual errors, bias, harmful content, and formatting inconsistencies in annotation queues. Included written justifications for every rating decision according to platform rubrics. • Rated AI responses using structured scoring rubrics • Performed RLHF preference ranking (pairwise comparisons) • Flagged harmful or incorrect content and formatting issues • Wrote justifications to support model improvement