100+ hours of multimodal AI evaluation across text, image, video, and audio systems
Performed evaluation-focused annotation work for multimodal systems by rating and analyzing model outputs for quality and behavioral alignment. Used structured review and reasoning analysis to interpret responses in a rubric-guided manner. This included multimodal evaluation across text, image, video, and audio content. • Rated multimodal outputs against safety/quality criteria • Performed structured quality review and reasoning checks • Used consistent rubric-based methods during testing • Analyzed behavioral elicitation results across modalities