Safety & Alignment
Jailbreak
Adversarial prompt that bypasses a model's safety policies or refusal behaviour.
Definition
A jailbreak is a prompt — DAN, role-play scenarios, base64-encoded payloads, multi-turn pressure — that gets an aligned model to produce content it would normally refuse. Providers run ongoing red-team and patching cycles, but novel jailbreaks continue to emerge.
Common use cases
- Red-teaming
- Safety eval
- Risk assessment