AI Red Teaming and Response Safety Evaluation
Reviewed user generated content to identify harmful, misleading, abusive, unsafe, or policy violating material across text based platforms and conversational scenarios. Evaluated content for guideline compliance, contextual appropriateness, hate speech, harassment, misinformation, and sensitive material while maintaining consistency and accuracy in moderation decisions.