Safety & Alignment
Red Teaming
Systematic adversarial testing of an AI system to find failure modes before deployment.
Definition
Red-teaming spans manual exploration, automated jailbreak generation, and formal evaluations probing dangerous capabilities (cyber, CBRN, persuasion). Frontier labs run dedicated red teams; results inform safety filters, refusal training, and model cards.
Common use cases
- Pre-deployment safety
- Policy compliance
- Threat modelling