Safety & Alignment

Red Teaming

Systematic adversarial testing of an AI system to find failure modes before deployment.

Definition

Red-teaming spans manual exploration, automated jailbreak generation, and formal evaluations probing dangerous capabilities (cyber, CBRN, persuasion). Frontier labs run dedicated red teams; results inform safety filters, refusal training, and model cards.

Common use cases

  • Pre-deployment safety
  • Policy compliance
  • Threat modelling

Related terms

    Red Teaming — AI Glossary | Railwail