Safety & Alignment

AI Safety

Field studying how to build AI systems that are reliable, controllable and beneficial.

Definition

AI safety spans near-term concerns (bias, misuse, jailbreaks) and longer-term ones (misalignment of advanced systems, catastrophic risk). Research areas include alignment, interpretability, evaluations, governance, and responsible deployment.

Common use cases

  • Safety research
  • Policy
  • Deployment review

Related terms

    AI Safety — AI Glossary | Railwail