Safety & Alignment

Guardrails

Programmatic validators that constrain LLM inputs and outputs against policies.

Definition

Guardrails frameworks (Guardrails AI, NeMo Guardrails, Llama Guard) intercept model I/O to enforce schemas, detect PII, block jailbreak attempts and ensure topical relevance. They complement provider-side safety with application-specific rules.

Common use cases

  • Trust & safety
  • Compliance
  • Domain restriction

Related terms

    Guardrails — AI Glossary | Railwail