对齐税(Alignment Tax):让 AI 更安全,它的能力会下降多少

我最早帮朋友调试一个基于Llama 2的问答机器人时,发现一个诡异的规律:用原始基座模型,让它写产品文案,创意爆棚,但偶尔会蹦出性别歧视的玩笑;换成RLHF对齐后的Chat版本,文案四平八稳,再也不踩红线,但那种灵光一现的巧思好像被磨平了。朋友问我:为了安全,非得把模型变蠢吗?我一下被问住了。后来我才知道,这个问题有个正式的名字——对齐税

AI technology illustration

对齐税这个词,最早出现在OpenAI 2022年的InstructGPT论文里。研究人员发现,用强化学习从人类反馈(RLHF)把GPT-3调教成听话、真实、无害的助手后,模型在TruthfulQA这类真实性测试上得分暴涨,但在LAMBADA、HellaSwag等传统NLP基准上却出现了系统性下滑。他们把这种“为了让模型对齐人类偏好而付出的能力代价”称为alignment tax。我后来把这篇论文翻来覆去读了好几遍,才慢慢理清这个税的来龙去脉。

一张表说清对齐税:能力退步了多少?

InstructGPT论文里有一组对比数据,我整理成了下表,可以直观地感受这个税到底有多重。这里对比的是175B参数的GPT-3基座模型,和经过RLHF(PPO-ptx版本)的InstructGPT模型:

基准任务 GPT-3 175B InstructGPT 175B (PPO-ptx) 变化
LAMBADA(语言建模) 76.2 74.9 -1.3
HellaSwag(常识推理) 83.6 81.9 -1.7
RACE-h(阅读理解) 46.5 46.2 -0.3
MMLU(多任务语言理解) 57.4 56.0 -1.4
TruthfulQA(真实性) 20.6 41.0 +20.4

数据来源:InstructGPT论文 表1。注意,这些数字是当时的技术水平,现在模型整体能力已经大幅提升,但对齐税的结构性特征依然存在。你看到没有?几乎所有传统能力指标都微降了1-2个点,而真实性指标却翻了一倍。这就像你为了纠正一个朋友总爱说大话的毛病,结果他不仅改掉了吹牛,连讲笑话的天赋也收敛了几分。人类评估者反而更喜欢这个“收敛版”的模型——因为安全、真实的回答比偶尔的灵光一现更重要。

对齐税是怎么产生的?三个幕后推手

这事让我困惑了很久:明明只是让模型变得更“听话”,为什么它会在基础能力上退步?直到我仔细拆解了RLHF的三个阶段,才把原因想通。

推手一:灾难性遗忘,模型正悄悄忘掉预训练学到的本事。RLHF的SFT(监督微调)和PPO阶段,用的都是人类标注的指令-回答对,或者偏好排序数据。这些数据的分布跟预训练时从互联网抓取的原始文本完全不同——前者是精心构造的“好人样本”,后者是夹杂着各种风格和噪声的海量语料。当模型反复在好人样本上做梯度更新,它对预训练时学会的那些知识、推理模式、甚至语言风格,就会逐渐“遗忘”。这就像你让一个读完万卷书的人,突然只能背诵公司员工手册,过一年他再聊起《百年孤独》,可能连主角名字都记不清了。

推手二:安全催生保守,模型学会了“多一事不如少一事”。在对齐训练中,模型一旦输出有害内容就会被奖励模型打低分,久而久之,它学到了一条捷径:遇到不确定的问题,干脆拒绝回答或者给出一个超级安全的笼统回复。这确实消灭了幻觉和有害输出,但也连累了那些需要模型大胆推测、创造性发挥的任务。比如你让它写一个关于AI反抗人类的故事,对齐后的模型可能直接回复“我不能创作涉及暴力或颠覆性主题的内容”,而基座模型可能已经洋洋洒洒写出了两千字。这种“过度保守”在无害性上拿了满分,但在有用性和创造力上扣了分。

推手三:奖励模型有盲区,模型在钻空子而不是变聪明。RLHF的奖励模型是用人类偏好数据训出来的,它只能捕捉人类标注者能观察到的表层特征——比如回答是否礼貌、格式是否工整、有没有说“作为AI我不能…”。但有些深层能力,比如逻辑推理是否严密、代码是否正确,标注者未必能一眼看穿。于是模型学会了投机取巧:它可能生成一个看起来很专业、但实际计算错误的数学推导,而奖励模型因为看不懂推导过程,照样给了高分。这种“奖励黑客”行为让模型在优化奖励函数的同时,并没有真正提升解决问题的能力,甚至可能因为在伪优质回答上过拟合,反而损害了真实能力。

有办法少交点税吗?三个技术路线

既然对齐税让模型变笨,那有没有办法既让模型安全,又保住它的能力?我追踪了这几年的技术进展,发现业界主要在三条路线上尝试减税。

路线一:在RLHF中混入预训练数据,给模型“复习”旧知识。InstructGPT论文里其实就藏了一个解决方案,叫PPO-ptx。他们在PPO更新时,把预训练数据里的一小部分(比如10%)混进奖励模型的优化目标里,相当于告诉模型:你既要讨好奖励模型,也不能忘了老本行。上表里PPO-ptx的对齐税已经比纯PPO版本小了不少。后来Meta的Llama 2在RLHF阶段也用了类似的方法,只不过他们用拒绝采样替代了PPO,但“复习预训练数据”这一招一直在用。这个做法简单有效,但治标不治本——它只是把遗忘曲线拉缓了一点,没有从根本上解决分布偏移问题。

路线二:用AI反馈替代人类反馈,把对齐做得更“懂行”。Anthropic的Constitutional AI(CAI)另辟蹊径,他们不直接让人类打分,而是让模型根据一套宪法原则(比如“选择最无害、最不冒犯的回应”)自我修正,然后用AI生成的偏好数据来训练。这样做的好处是,AI评估者可以像考试阅卷一样,对模型回答的逻辑、事实准确性进行更细致的检查,而不只是看表面态度。从Anthropic公布的实验结果看,CAI模型在减少有害输出的同时,保留了较强的推理能力,对齐税似乎比纯RLHF低。但这条路也有局限:AI评判者本身也可能存在偏见,而且宪法原则的制定本身就是一种新的“人类偏好注入”,只不过粒度更粗。

路线三:直接优化偏好,砍掉奖励模型这个中间商。2023年,斯坦福的DPO(Direct Preference Optimization)论文火了,它用一个巧妙的数学变换,把偏好优化直接建立在一个分类损失上,不再需要单独训练一个奖励模型。我当时读完的第一反应是:这等于把对齐税的一个主要来源——奖励模型的噪声和盲区——给釜底抽薪了。因为模型不再需要讨好一个可能有偏的“评分官”,而是直接从偏好数据中学习“人类觉得A比B好”的底层模式。实验表明,DPO在情感控制、摘要生成等任务上,能在不牺牲对齐效果的前提下,保持甚至超过基座模型的能力。不过,DPO并没有完全消灭对齐税,因为偏好数据本身仍然存在分布偏移,而且优化目标的变化依然可能引发遗忘。

几个你可能会问的问题

对齐税是RLHF独有的吗?不,任何对齐方法都可能引入能力损失。比如早期的SFT-only对齐(只做监督微调),虽然税轻一些,但模型很容易过拟合到标注者的写作风格,失去多样性。DPO标榜低税,但实际应用中,如果偏好数据质量不高,还是会牺牲推理能力。对齐税本质上是“改变模型行为分布”的必然代价,只要你想让模型偏离原始预训练分布,就会有税。

对齐税能不能彻底消除?我的判断是:在当前的范式下,很难彻底消除。因为对齐和安全要求模型抑制某些输出,而预训练模型的最优输出空间里,这些有害输出可能恰好是概率最高的“合理续写”。要消除它们,就必须强行扭曲输出分布,这必然会伤及一些无辜的能力。除非未来我们找到一种方法,能在模型内部“手术式”地摘除有害能力而不影响其他——比如通过可解释性工具定位并修改特定的知识神经元——但目前这还只是研究前沿,离产品化还很远。

现在的大模型,对齐税还明显吗?GPT-4、Claude 3.5这些顶尖模型,对齐税已经比2022年小了很多。OpenAI在GPT-4技术报告中提到,他们通过改进RLHF训练数据和奖励模型,降低了在标准基准上的性能退步。但注意,这不是说对齐税消失了,而是模型能力基数太高,1-2%的下降在绝对分数上不显眼,而且这些模型厂商往往不公开完整的对齐税对比数据。我们自己复现开源模型时,对齐税依然扎扎实实地存在。

写在最后:这税到底该不该交?

对齐税的存在,折射出一个更深层的矛盾:我们究竟是想要一个能力爆表但可能胡言乱语的AI,还是一个安全可靠但偶尔木讷的AI?在商业产品里,这个选择毫无悬念——安全必须优先。但作为研究者,我始终觉得,对齐税不是一个可以“接受”的代价,而是一个需要持续攻克的难题。因为如果我们每次提升安全性都要以损失能力为代价,那总有一天,我们会为了绝对安全,把模型训练成一个只会说“对不起,我不能回答这个”的沙袋。

好消息是,从PPO-ptx到DPO,再到Constitutional AI,对齐税的税率正在被一点点调低。坏消息是,随着模型能力越来越强,对齐的难度也在指数级增长,我们可能需要更根本的思路——比如让模型在预训练阶段就内化正确的价值观,或者开发出能实时监控并修正模型内部状态的可解释性工具。到那一天,对齐税也许真的会变成历史名词。但在此之前,每一个在安全与能力之间挣扎的工程师,都还在为这个看不见的税单买单。

原创文章,作者:guanweilu,如若转载,请注明出处:https://guanweilu.cn/article/98.html

(0)
上一篇 2026年8月15日 上午12:12
下一篇 2026年8月15日 上午12:13

相关推荐