AI Content Evaluator & RLHF Specialist (Freelance), DataAnnotation
Provided RLHF-oriented preference ranking and comparative evaluations of model responses using structured rubrics. Evaluated AI-generated outputs for factual accuracy, reasoning quality, instruction-following, and cultural fit in Portuguese (PT-BR) and English. Designed and supported evaluation processes for LLM training datasets requiring legal reasoning and case-based analysis.• Assessed hallucinations, reasoning errors, and cultural inaccuracies in multilingual AI outputs.• Performed preference ranking across multiple concurrent projects while maintaining benchmark calibration.• Built prompt and golden reference answer sets for legal/statutory/case-based tasks.• Participated in structured QA review cycles to ensure consistency across Portuguese-language evaluation benchmarks.