Multimodal Ai response evaluation
Evaluated and compared AI-generated responses across text and image-based tasks. Assessed factual accuracy, instruction following, relevance, reasoning quality, and overall user preference to improve model performance and reliability.