AI 安全对齐:当模型能力超过人类判断能力时,我们如何确保它「做对的事」?

GPT-4、Claude、Gemini——这些模型已经强大到让它们的内部决策变得不透明。当我们无法可靠地判断模型的「好坏」时,如何训练它做出正确的选择?本文系统梳理 AI 安全对齐的技术路线与开放挑战。

一、为什么安全对齐是 AI 发展的核心瓶颈

对齐(Alignment)问题的本质是价值对齐(Value Alignment):如何确保高度智能的系统追求的目标,与人类利益和价值观一致?

这个问题的严峻性来自三个维度: