Freelance AI Content Reviewer and Data Evaluator - Freelance
The role involved reviewing and ranking LLM-generated responses for quality, accuracy, tone, safety, and formatting compliance. It required creating robust prompts to evaluate model behavior across edge cases and reasoning scenarios. It also demanded strict adherence to evaluation guidelines while maintaining high accuracy and timely weekly output. • Evaluated and ranked model responses using predefined quality and safety criteria. • Authored prompt sets to stress-test capabilities, reasoning, and failure modes. • Produced annotated insights for dataset quality and classification needs. • Performed fact-checking against trusted sources and corrected detected errors.