Handshake AI — Adversarial Red Teamer (Contract)
Conducted adversarial red-teaming and evaluation of LLM safety, reasoning, and policy compliance using multi-turn attack sequences. Produced and assessed harmful or misuse-oriented prompt variants to identify jailbreak resistance and failure patterns. Translated observed weaknesses into actionable recommendations to expand evaluation coverage and improve safer model behavior. • Designed adversarial prompts and multi-turn attack sequences for safety stress tests • Evaluated frontier model behavior across high-risk edge cases • Identified failure patterns and documented misuse pathway risks • Provided actionable insights to improve evaluation coverage and safety outcomes