AI Evaluation Research Consultant - Freelancer
Independent AI evaluation and research work supporting iterative improvements to large language model outputs. Applied RLHF-style ranking and comparative assessment to judge quality, alignment, and policy compliance. Built and stress-tested prompts, then produced structured reports and technical documentation for multi-criteria project guidelines. • Evaluated responses for accuracy, logical coherence, reasoning quality, and domain relevance • Engineered prompts to probe instruction following, classification, and generation capabilities • Performed content moderation and QA checks against safety and policy standards • Delivered technical writing, transcription, translation support, and research for evaluation pipelines