Safety & Alignment
Bias
Systematic skew in model outputs reflecting unrepresentative data or training choices.
Definition
Bias in AI ranges from gender and racial stereotypes to political leaning and cultural blind spots, mostly inherited from training data. Mitigations include curated data, RLHF, debiasing prompts and post-hoc filters; complete neutrality remains an unsolved problem.
Common use cases
- Fairness audits
- Compliance reviews
- Diverse evaluation