AI Safety Evaluator / Prompt Engineering via adversarial testing and structured LLM assessment (Research assistant role)
Conducted AI model evaluation using adversarial testing to assess robustness and safety behaviors. Engineered and optimized prompts to improve model responses and reduce failure cases during evaluation. Performed structured assessment of large language model outputs for research writing and data evaluation workflows. • Evaluated outputs via risk assessment criteria • Performed jailbreak testing as part of red-teaming style checks • Iterated prompts based on observed model behavior • Documented results to support research writing