Senior AI/ML Evaluation Specialist - Handshake AI
Evaluate side-by-side LLM responses on reward-model annotation tasks across computer science domains, derive ground truth for algorithmic coding prompts, verify solutions with brute-force oracles and differential testing in Python and C++, document preference scores with evidence-based rationales, rewrite model outputs for factual accuracy and LaTeX compatibility, and review web-research training-data quality.