Red-teaming activities (part of AI Trainer & Data Annotator work at Luel-AI)
Performed red-teaming and safety analysis to uncover vulnerabilities in LLM instruction following. Identified jailbreak-prone instruction patterns and edge-case failures to inform safer model behavior. Applied consistent reporting to support training and mitigation efforts. • Tested prompts to elicit unsafe or undesired outputs • Logged failure modes and safety weaknesses for review • Assessed robustness under adversarial or ambiguous instructions • Contributed to iterative safety improvements