Safety & Alignment

Jailbreak

Adversarial prompt that bypasses a model's safety policies or refusal behaviour.

Definition

A jailbreak is a prompt — DAN, role-play scenarios, base64-encoded payloads, multi-turn pressure — that gets an aligned model to produce content it would normally refuse. Providers run ongoing red-team and patching cycles, but novel jailbreaks continue to emerge.

Common use cases

  • Red-teaming
  • Safety eval
  • Risk assessment

Related terms

    Jailbreak — AI Glossary | Railwail