Safety & Alignment
AI Safety
Field studying how to build AI systems that are reliable, controllable and beneficial.
Definition
AI safety spans near-term concerns (bias, misuse, jailbreaks) and longer-term ones (misalignment of advanced systems, catastrophic risk). Research areas include alignment, interpretability, evaluations, governance, and responsible deployment.
Common use cases
- Safety research
- Policy
- Deployment review