Model Red-Teaming & Adversarial Safety Evaluation
Conducted rigorous safety testing and vulnerability mapping on frontier large language models to eliminate security and alignment vulnerabilities. Authored and evaluated thousands of complex, multi-agent adversarial prompts using advanced frameworks to probe for jailbreaks, tracking exploit pathways, and labeling model outputs for explicit policy compliance and risk mitigation.