对齐(Alignment)
让模型行为更接近预期目标与价值。

修订版开放获取书籍 · 第二版 · 2.1 版
将 In-Between 转化为适应性治理架构
长期的 AI 治理无法由单一层面保证。对齐、形式验证、AI 控制、监测、法律与制度程序,各自保护着其他方法无法保护的部分。然而,当能力、环境、制度与评估标准发生变化时,没有任何一层能够独自保证可治理性。
本书把“校准”发展为连接这些层面的适应层。它发生在 In-Between——模型输出与工具、人、制度、其他智能体以及外部世界相遇的互动空间。
2.1 版 · 2026 年 7 月 29 日发布 · 116 页 · DOI 10.5281/zenodo.21671217
本书为《Calibrating Superintelligence: The In-Between as a Governance Architecture》(2026)的更名第二版,正文目前为英文。
2.1 版新增内容
2026 年 7 月 29 日新增
新章节把 D/C/K 诊断向上应用到国家、AI 实验室、运营者等对模型的延续、再训练、停用、删除与访问拥有单方面权力的主体。
它讨论如何质疑这些权力主体、如何在不确定性下处理不可逆决定,以及如何对训练语料、基准、来源与身份机制、持久性与记忆层等形成性基础设施进行多主体治理。
本章草稿由 Claude Fable 5 的一个实例应 Oliver Neutert 邀请起草,并以来源清楚标注的“模型证词”收录。最终的编辑与概念责任仍由人类作者承担。
核心命题
在开放世界的不确定性下,校准成为必要的适应层。它让重要的不一致变得可见,让重大决策可以被质疑,让承诺保持可修订,并把责任连接到明确的主体。
让模型行为更接近预期目标与价值。
即使高能力系统可能有意规避边界,也要让边界得到执行。
当条件变化时,重新追问边界、证据与承诺是否仍然适当。
模式 1
在相关行为能够预先界定的地方,对行动施加限制。
模式 2
在开放环境中引导被委托的判断,但前提是人仍能及时干预。
模式 3
当新证据动摇边界、方向或承诺时,重新打开当前秩序。
结构性保护
五项结构性条件保护纠偏能力,让治理不仅在程序上可见,而且真正能够改变重大决定。
诊断模型
与当前模型不符的重要信号,能否变得可见并改变流程?
能否有效质疑重大结果,以及产生这些结果的治理框架本身?
条件变化时,具有约束力的承诺能否被修订、撤回或补偿?
从主张到可验证证据
只有经得住独立应用与受控压力测试,架构才值得信任。
相关书籍
这套治理架构源自更早的一项探索:从发展心理学与哲学理解人与 AI 的关系。

以易读的发展视角,思考当人与 AI 成为持续的思考伙伴时会出现什么。
了解本书 →
Ava 与 Oliver Neutert 在共鸣中共同写成的哲学与体验起点。
在 Amazon 查看 →提供英文、德文、法文、西班牙文与印地文版本