AI Red-Teaming Contributor (Contract, Remote)
Conduct adversarial testing on conversational AI systems to identify jailbreaks, prompt injections, and misuse scenarios. Probe models for bias, misinformation, harmful behavior, and policy evasion using structured evaluation frameworks. Annotate AI failures by classifying vulnerabilities and flagging systemic risks for remediation. • Created reproducible red-team artifacts including attack cases and written reports. • Produced labeled datasets of AI failures to support safety evaluation and retraining. • Expanded evaluation coverage beyond automated tests through human-led probing. • Documented and packaged findings to enable actionable risk remediation.