有一个问题困扰了我很久:你怎么让一个比你聪明得多的 AI 听你的话?

这不是"怎么管住熊孩子"的问题——熊孩子再熊,你至少能判断他做的事对不对。但面对一个在几乎所有维度上都超过你的智能体,你连它做的是对是错都判断不了。你不能验证的东西,就不能监督。这是 AI 对齐问题的死结。
有一篇 2018 年的论文想从这个死结里钻出去。作者是 Paul Christiano 和他的 OpenAI 同事,论文叫 Supervising strong learners by amplifying weak experts。这个方法后来有了个更广为人知的名字:迭代放大(Iterated Amplification)。
我第一次看它的概述时,误以为它是"把一个弱 AI 拆成多个子任务"。我困惑了很久——把任务拆小,这不是程序员天天干的事吗?跟 AI 安全有什么关系?读了原文才明白:它拆的不是 AI,是验证。它不试图直接判断"这个难题的答案对不对",而是把难题拆成一个个小到能被人类验证的步骤,逐级验证,再逐级组合。
你能验证什么?这决定了你能监督什么
先做个思想实验。假设你要判断一份关于量子计算的深度报告写得好不好。你不是物理学家,判断不了报告的整体质量。但你能判断什么?
- 报告中引用的论文标题和作者是否真实存在。
- "这段摘要有没有忠实于它所引用的那篇论文"。
- "这两处结论之间是否存在矛盾"。
你验证不了整体,但你能验证局部。迭代放大想利用的,正是这个缺口。
放大:把难题拆到"每一步都能验证"为止
假设你要训练一个 AI 回答"美国内战爆发的主要原因"。这个问题太难,你无法直接评估模型的回答。但你有一个弱模型——它做不了历史综合分析,却能列出提纲、搜索资料、逐段总结、检查矛盾。于是你让它这样做:
- 列出可能导致内战的 8 个候选因素。
- 为每个因素搜索 3 个独立的史料来源。
- 用一段话总结每个来源的核心观点。
- 标出这些观点之间的共识与冲突。
- 把总结组织成一篇完整报告。
每一步,模型做的都是它能力范围内的小事;每一步,你都能亲自验证:来源是真的吗?总结忠实吗?共识与冲突找对了吗?当每一步都验证通过后,组合起来的报告整体也可信——尽管你自己写不出这份报告。
这就叫放大(Amplification):用一个弱模型加上你的验证,组合出超出弱模型本身能力的可靠结果。如果某个子任务对弱模型来说还是太难,就递归——继续拆,一直拆到每个原子步骤都落在"弱模型能做、你能验证"的范围内。
蒸馏:把"验证过的过程"压缩进新模型
放大很美,但太慢。每次回答都要拆几十步、人等着一一验证,没法用于生产。于是有了第二步:蒸馏(Distillation)。
你收集放大过程产生的一大批已验证轨迹——原始问题、每一步子任务、每一步的验证结果、最终的完整答案——用它训练一个新模型,让新模型学会直接回答这个级别的问题,不再需要拆开验证。
新模型把整个放大过程内化成了自己的技能:面对复杂问题,自动列出候选因素、找证据、核对矛盾、组织答案。这些曾经显式的可验证步骤,被压缩成了一次前向传播。
循环:用更强的模型,拆更难的任务
蒸馏出来的新模型比弱模型更强。把它放到弱模型的位置上,它能拆解旧模型拆不动的问题。每一轮,让新模型拆更难的任务,你继续验证每一步,验证通过后再蒸馏……
每一轮,模型的能力上限向上抬一点;但训练它的信号,永远来自一条你全程能追溯的验证链。
我第一次理解到这个循环时,卡了很久:下一轮放大,谁来验证新模型的输出?它自己验证自己,不等于没验证吗?
后来我想通了。验证者从来不是"当前最强模型",而是"人类 + 上一轮已被验证过的模型"这个组合。信任是一级一级台阶传上去的,不是从半空中搭上去的。模型的能力可以突飞猛进,但训练信号的根,永远扎在人类能验证的土壤里。
论文的核心主张也在这里:我们不必给"什么是好答案"下定义,只需要提供一个可验证的过程,再让模型逐步内化这个过程。
把它和另外几条对齐路线放在同一张桌上
迭代放大不是唯一方案。它和 RLHF、AI 辩论、递归奖励建模的根本区别在于"谁在验证、验证什么":
| 方案 | 谁在验证 | 验证对象 | 强模型学什么 |
|---|---|---|---|
| RLHF | 人类 | 模型的整体输出 | 模仿人类的偏好打分 |
| 迭代放大 | 人类 + 弱模型 | 每步子任务的输出 | 已验证的放大轨迹 |
| AI 辩论 | 人类 | 两个 AI 的辩论 | 辩论获胜方的发言 |
| 递归奖励建模 | 弱模型预测人类 | 模型的整体输出 | 最大化预测的奖励 |
RLHF 的问题在于:输出复杂到人类判断不了时,人类打分就失效了。这堵墙今天已经摸到了——你让人给一篇 AI 写的长文在"事实准确性"上打 1-5 分,结果通常惨不忍睹。AI 辩论试图让两个强 AI 互相挑错、人来当裁判,但前提是辩论能让关键错误暴露出来。迭代放大则选择最"笨"的路:不从强模型那里拿信号,而是把强任务一路拆到能验证的粒度,再让强模型模仿这个验证过的过程。它的赌注是:验证的可靠性,比模型的聪明程度更重要。
三个它解决不了的问题
第一,不是所有任务都能拆。"写一首动人的诗",怎么拆?拆成"每句押韵""不重复用词"?局部验证全通过,组合起来也未必动人。审美、创意、科研选题——这类任务的整体性质无法从子任务推导出来。放大只在可分解的任务上成立。
第二,验证链的最底层永远是人类。当任务难到子任务本身也超出人类理解时,人就没法验证了。论文的回应是"用前几轮的模型辅助验证",但这引入了一个隐患:如果某个中间模型已经悄悄有了问题,且人察觉不到,错误就会沿着验证链传下去。链条的安全性,取决于最弱的一环。
第三,蒸馏会丢东西。新模型学到的是"看起来像验证过的输出",不一定是"验证过的推理过程"。它可能走捷径——形式上正确、底层完全换了套逻辑。形式正确而实质错误的答案,今天的大模型里到处都是;蒸馏并不能免疫。
还有个容易被忽略的问题:验证者的偏见会被放大。如果你有自己都没意识到的偏好——偏爱某种文风、某种论证结构——放大机制会忠实地把它放大,蒸馏出的模型可能比你还"性格鲜明"。对齐要对齐的是人类价值观,不是某个验证者的怪癖。
它的思想已经悄悄渗透进今天的 AI
迭代放大没被大规模原样实现,但它的影子到处都是。OpenAI 2023 年的Let’s Verify Step by Step 就是典型:放弃"给最终答案打分",改为在每一步推理上做过程监督。动机多半是提升正确率,但机制和放大同出一源。
更直接的检验是 Weak-to-Strong Generalization——OpenAI 让 GPT-2 当监督者、GPT-4 当学生,直接测试"弱监督者能否教出强模型"。结果喜忧参半:强模型确实能学到大部分能力,但距离完美监督的上限还有明显差距,弱监督者的错误会被学生以某种方式放大。这说明迭代放大的核心假设不是空想,但也远没有论文最初设想的顺畅。
我的判断
迭代放大是 AI 对齐领域最严肃的尝试之一。核心洞察——验证过程比验证结果容易,信任可以逐级传递——经得起推敲。但我不认为它能独立解决问题。
它的适用边界很清晰:只在任务可分解、每步可验证、验证者本身可靠时成立。判断一个任务能否套用迭代放大,就问三个问题:能拆吗?拆到底每一步还在可信验证者能力范围内吗?验证者自己会不会悄悄出错?任何一个答不上来,链条就会断。
它留下的最重要的遗产,可能不是方法本身,而是一个框架:对齐不必只在"目标函数"上做文章,也可以在一个可验证的产生过程上做文章。今天的过程监督、可解释性研究、AI 反馈强化学习,多少都是这个框架的投影。
至于怎么让一个比你聪明的 AI 听你的话——迭代放大没有给出最终答案。但它给出了一条极诚实的进路:承认你验证不了全部,把能验证的部分做到极致,让更强的东西从这条验证链上长出来。目前为止,这是我见过最不坏的选择。
原创文章,作者:guanweilu,如若转载,请注明出处:https://guanweilu.cn/article/385.html