AI Evaluation Specialist
Evaluated LLM and AI model outputs for safety, fluency, accuracy, and instruction-following. Conducted preference ranking and feedback tasks for model response improvement. Evaluated grammar correction, smart reply, and personalized email generation within language models. • Rated and ranked LLM completions. • Proofread grammar correction outputs. • Assessed language model personalization. • Provided structured model performance feedback.