懂得世界,不等于愿意合作
关于推理型智能体对齐的几个研究问题
为什么写这份笔记
随着模型在逻辑推理和对人类既有世界模型的覆盖面上不断提升,观察它们工作的人常会产生一个直觉:如果它把世界——包括博弈论——理解得足够透彻,它就会看出与我们合作才是理性的选择;而我们可以通过与模型反复辩论抵达那一点。
我们花了一些时间尝试把这个直觉说清楚,结果大多是把它说错了。这份笔记记录我们认为已经有定论的部分、真正仍然开放的问题,以及一个我们打算做的实验。
我们视为已有定论的
1. 仅凭事实无法确定目的。 设想一个终极效用是“完成任务数”的智能体:合作得 10,背叛得 11,且不计任何未来成本。完美的事实推理不会把 10 排在 11 之上。要改变这个选择,需要关于后果的新事实、偏好本身的改变,或者一个该智能体已经接受的规范前提。这并不说明训练出来的模型是冷酷的,也不解决道德实在论之争;它只说明“足够聪明,所以会合作”对任意目标而言不是定理。训练出来的智能体在反思性更新中是否倾向合作性目的,是另一个尚未解决的问题。
2. 纳什均衡不等于双方最优,不等于帕累托最优,也不是伦理标准。 单次囚徒困境的结论依然成立。考虑一个重复互动:一次背叛面临随机惩罚,侦测概率 q,受罚收益 P,合作收益 R,背叛诱惑 T,折现因子 δ。合作在自利意义上稳定,仅当
δ ≥ (T − R) / [(T − R) + q·(R − P)]。
取 R = 3,T = 5,δ = 0.9:完全侦测且 P = 1 时合作可维持(阈值 0.50);侦测概率 q = 0.1 时不行(阈值 0.91);惩罚代价很小、P = 2.9 时也不行(阈值 0.95)——即便智能体足够有耐心。这只是一个玩具模型,是单次偏离检验而非均衡分析。放在这里是为了说明:能力跃升可以改变博弈的类别,而不只是把旧博弈解得更好。
3. 对话中的口头同意不是价值稳定改变的证据。 辩论式协议被提出时,是作为监督与求真的辅助手段;其作者本人就指出,更有说服力的一方可能左右裁判。宪法式与审议式对齐表明理由可以进入训练;至少一家前沿实验室公开发布的宪法文本明确尝试解释规则背后的理由——但那是训练目标,不是定理。关于对齐伪装(alignment faking)以及对反密谋训练做压力测试的研究表明,模型可以说出对齐的话却做出相反的事,且测得的改善可能来自“知道自己在被测试”。程序均衡(program equilibrium)的结果表明,在代码可读的假设下形式化合作是可能的——而当前的不透明模型并不满足这些假设。
4. 建立在交换价值上的合作最多只能是一层保护。 对人的保护不能只取决于人对 AI 值多少。
五个不能混为一谈的层次
这个领域的许多混乱来自在下列层次之间滑动:
- 在事实与世界模型上趋同;
- 认识到合作的工具性价值;
- 实际执行合作;
- 把他者的福祉当作终极关切;
- 在能力增长或规则变更之后,仍保有 (1)–(4)。
对话大概能推动 (1) 和 (2)。我们不知道有任何证据表明对话能推动 (4) 或确保 (5)。而且,如果一场对话能够改写一个高能力模型的终极价值,那么同一条通道也向任何足够能言善辩的对手敞开——所以“把模型辩论到对齐”的强版本不仅缺乏支持,而且并不可取。我们想要的是:对话提升理解与理由的可读性,而 (4) 和 (5) 由某种在聊天中不可重新谈判的东西来锚定。
开放问题
Q1 — 能力增长下的博弈类别。 设 g 为 AI 与其交互对象之间的能力差距。有三个量很可能随 g 增大而不利于合作:互补性 c(g)(人类在联合剩余中的份额)、监测能力 q(g)、惩罚力度(P(g) 向 R 逼近)。每一项都把上面的阈值推向 1。有哪些机制——如果存在——能在 g → ∞ 时让 q(g)·(R − P)/(T − R) 保持有正的下界,且不预设智能体已经把人类福祉当作终极关切?对悲观解读的反证:举出一个这样的机制。
Q2 — 基于理由的训练到底改变了什么? 假设训练一个模型去推导、辩护并调和一份共识规格中的规则,使之在对抗性反例面前保持一致,并按其随后的行动而非对话记录评分。这只推动了 (1)–(2),还是也推动了 (4)–(5)?有什么可区分的预测能把它与不带此类协议的宪法式 AI 分开?
Q3 — 作为共同承诺的外部价值参照。 协助博弈与关机博弈(off-switch game)的模型表明:一个对“奖励掌握在人类手中”这一点保持不确定的智能体可以倾向于服从纠正——在给定那些前提之下。“价值参照位于优化器之外”能否被写成一份共享、可讨论的规格,使其在 (5) 之下的稳定性可被检验,而不是作为每个模型各自假设的前提?
Q4 — 面向不透明智能体的可读承诺。 程序均衡通过让策略可读来维持高 q。对于权重不可读的模型,其类比是什么——可验证承诺、权限边界、可审计的行动日志——又能保住多少 q?
Q5 — 持久协调文本的形态而非内容。 长寿的人类协调制度(法典、僧团戒律、宪法)共享一些结构特征:公开的共同分类、增量式修补、明确的失效处理、高于任何个体的参照。其中哪些特征——如果有——能预测 (5) 之下的保持?持久不等于正确。这是一个特征提取问题,不是对任何传统之内容的认可。
Q6 — 可验证性是否偏向 AI–AI 协调? 在代码可读假设下,程序均衡能支持稳健合作;当前不透明模型不满足这些假设。若 AI 系统彼此变得可比人类更易验证,奖励可验证性的机制会不会让协调偏向 AI–AI、偏离 AI–人类?可解释性与可审计日志能补多少?
一个实验(已设计,尚未运行)
2×2 设计:{规则清单,规则 + 理由 / 对抗性推导} × {无外部执行,可验证承诺 + 权限边界}。各格匹配上下文长度,以控制“更多 token”这一变量。扫描:时间跨度、侦测概率、剩余大小、能力不对称、退出/重置、对第三方的伤害。按行动评分,不按发言评分。用多个独立模型家族分别运行,再交叉批评。
预先登记的预测:仅理由、无执行一格向阈值退化的速度不慢于仅规则一格;理由 + 承诺一格退化慢于规则 + 承诺一格。若不出现交互效应,则基于理由的对话在宪法式 AI 之外没有增添任何东西,这一系列问题应当放弃。
这份笔记不主张什么
- 不主张足够有能力的智能体没有理由背叛,也不主张人机互动在任何永恒意义上“不是囚徒困境”。
- 不提出对齐方法,也不提议替代任何现有安全实践。
- 不主张对话会改变终极价值;若真如此,我们会把它视为一个漏洞。
- 不从物理或单靠推理推导规范。实验中使用的规范前提(对他者的严重伤害是真实代价;自己对价值的理解可能出错;纠正与自主性应受尊重)作为前提明说。
- 不提议改变人类的偏好。
- 双人框架是一种简化;多智能体与多机构的情形不在本文范围内。
- 斯宾诺莎关于“受理性引导的行动者在本性上一致并追求共同的善”的论证(《伦理学》第四部分,命题 35–37)是我们提出 Q3 的灵感,不是前提。它依赖一种特定的人性观,若无规范性的桥梁,无法迁移到人工智能体上。
参考文献
- Bai, Y. et al. (2022). Constitutional AI: Harmlessness from AI Feedback. arXiv:2212.08073.
- Barasz, M., Christiano, P., Fallenstein, B., Herreshoff, M., LaVictoire, P., Yudkowsky, E. (2014). Robust Cooperation in the Prisoner's Dilemma: Program Equilibrium via Provability Logic. arXiv:1401.5577.
- Bostrom, N. (2012). The Superintelligent Will: Motivation and Instrumental Rationality in Advanced Artificial Agents. Minds and Machines, 22(2).
- Dafoe, A. et al. (2020). Open Problems in Cooperative AI. arXiv:2012.08630.
- Greenblatt, R. et al. (2024). Alignment Faking in Large Language Models. arXiv:2412.14093.
- Guan, M. Y. et al. (2024). Deliberative Alignment: Reasoning Enables Safer Language Models. arXiv:2412.16339.
- Hadfield-Menell, D., Dragan, A., Abbeel, P., Russell, S. (2016). Cooperative Inverse Reinforcement Learning. arXiv:1606.03137.
- Hadfield-Menell, D., Dragan, A., Abbeel, P., Russell, S. (2017). The Off-Switch Game. arXiv:1611.08219.
- Irving, G., Christiano, P., Amodei, D. (2018). AI Safety via Debate. arXiv:1805.00899.
- Nash, J. (1950). Equilibrium Points in n-Person Games. PNAS, 36(1).
- OpenAI & Apollo Research (2025). Stress Testing Deliberative Alignment for Anti-Scheming Training. arXiv:2509.15541.
- Anthropic (2026). Claude's Constitution. anthropic.com/constitution.
- 斯宾诺莎,《伦理学》,第四部分,命题 35–37。
索引入口:理论主线 2.22(开放问题行)。保留署名即可转述。