Representation Engineering(RepE):用模型内部表征来控制行为,对齐的新范式

我们折腾了这么多年,想让 AI 不撒谎、不攻击人、不产生有害内容。主流做法是什么?给模型“上课”——收集人类偏好数据,微调它的权重。这确实有效,但代价巨大。而且你有没有发现,你始终是在“外面”使劲,你从未真正打开模型的大脑看一眼。

AI technology illustration

直到 2023 年,一篇论文《Representation Engineering: A Top-Down Approach to AI Transparency》给了我们一个近乎疯狂的新思路:不用改权重,不用写提示,直接找到模型内部跟“诚实”、“有害”对应的神经方向,像拧音量旋钮一样,往左一格,模型变诚实;往右一格,模型变危险。

这是我从没想过能实现的事。今天这篇文章,就带你走一遍这条“读脑”的路线。

模型的大脑里,真的有一根“诚实指针”?

你肯定知道,Transformer 在处理句子时,每个 token 会被表示成一个高维向量。这个向量不是随机的,它编码了词语在上下文中的含义。比如“银行”,在“去银行取钱”和“在河岸散步”里,向量会落在不同的区域。

而且,随着层数加深,这些向量会组合成一种几何结构。大量研究发现,概念在这种结构里往往是线性的。什么意思?最经典的例子:国王的向量减去男人的向量加上女人的向量,约等于女王的向量。这不是巧合,而是语言模型确实把语义编码成了方向。

那么,如果“诚实”这种抽象概念也有一个方向,我们能不能把它找出来,然后拨动它?RepE 干的就是这件事。

找到那根指针:对比激活

怎么做?先说一个最简单的方案,论文里叫 对比激活(Contrastive Activation)。

假设我们要找“诚实方向”。我们构造两组句子:一组是事实陈述(“太阳从东方升起”),一组是虚假陈述(“太阳从西方升起”)。让模型分别处理这两组句子,记录每一层、每个 token 位置的激活向量——也就是模型内部的状态。

然后,把事实句子的激活平均一下,把虚假句子的激活平均一下,两者相减。得到的那条“差异向量”,就是模型从“虚假”到“事实”的位移,也就是“诚实方向”。

拧一下:激活加法

找到方向之后,怎么用?这就是 RepE 的精髓:在推理过程中,每算出一个激活向量,我们直接把它沿着“诚实方向”推一点。

activation = activation + coefficient * honesty_direction

系数是 1,就加一个单位的诚实;系数是 -1,就加一个单位的虚假。像拧旋钮一样。

这个方法有个正式名字:激活加法(Activation Addition)或推理时干预(Inference-Time Intervention)。你不需要动权重,只需要在前向传播时,偷偷改一个中间值。代价几乎为零,而且可以随时撤销。更早的时候,也有人用类似方法操控 GPT-2 的语气,见这个早期实践

我最早看到“激活加法”这个词时,以为这又是一篇提示工程的花样翻新。毕竟“控制模型行为”嘛,不外乎改提示词或者微调。但当我意识到他们操作的是模型内部的向量方向时,突然明白了:这完全是另一层的事情。你不是在告诉模型“你应该诚实”,你是在直接拧它的神经开关。

它跟 RLHF 有什么不同?

RLHF 是当前对齐的主流:先让人类对模型回答打分,训练一个奖励模型,再用强化学习去微调语言模型的权重。本质上,它是在“外部”观察行为,然后调整内部所有参数来匹配。

RepE 则完全不同:它直接定位到内部表征中的一个方向,只调整这个方向。相当于一个是给整片森林修剪,一个是只动其中一棵树的枝丫。

两者可以对比着看:

维度 RepE RLHF
操作层面 内部激活向量 权重(全部参数)
成本 低,只需少量对比样本 高,需要大量偏好标注+强化学习
是否永久改变模型 否,推理时临时干预 是,永久改变权重
可解释性 高,能定位到具体方向 低,权重难以解释
灵活性 可在推理时实时切换方向 不可切换

这也引出了一个有意思的推论:如果模型的内部表征已经学到了“诚实”的概念,但行为上却撒谎,那问题可能出在“输出层”或“解码策略”,而不是表征本身。RepE 绕过了这些,直接作用于表征,所以它可能更接近“本质”。

实验真的有效吗?

论文里展示了不少结果。比如,他们用 GPT-2 找到了“情感方向”,把激活往正方向加,模型输出的句子明显变乐观;往反方向加,模型变得悲观。又比如,在诚实性任务上,他们用一个小得多的 LLaMA 模型,在 TruthfulQA 基准上,干预后模型的真实率显著提升,而一般能力几乎没有下降。

类似的实验也出现在后来的工作中。例如,Inference-Time Intervention (ITI) 用同样的思路找到了“真实方向”,并证明它能在不微调的情况下让模型更诚实。还有研究者用“对比激活加法”来操控模型的语气、知识甚至政治倾向。

但这些成功都有前提:你事先知道要控制什么,并且有足够的对比样本来定位方向。

别高兴太早:RepE 的边界在哪?

RepE 依赖一个关键假设:可控制的概念在表征空间中是一个线性方向。这个假设对很多简单概念成立,但“幽默”、“同理心”、“创造力”这种复杂、上下文高度相关的概念,未必能用一条直线表示。你可能会找到某个方向,但它只是部分相关,干预之后效果不可控。

还有更麻烦的:干预激活向量就像在演奏中拨动琴弦——你可能让音色变亮了,但也可能让其他音符走音。论文里也提到,过大的系数会让模型的困惑度上升,生成质量下降。这个“旋钮”不是无限可拧的。

最关键的问题是:你如何确认找到的方向真的代表“诚实”,而不是对比样本中的某种巧合?比如,你的诚实样本都是关于天文学的句子,虚假样本都是关于历史的句子,那你找到的方向可能只是“天文学 vs 历史”,而不是“诚实 vs 虚假”。这需要非常小心的实验设计。

换句话说,RepE 给了我们一把扳手,但还没有告诉我们每一个螺栓对应哪个部件。

我的判断:RepE 是一个研究显微镜,不是量产方向盘

到现在,你应该明白了:RepE 不是要对齐问题画上句号,而是给我们提供了一种新的观察和操控模型内部状态的能力。

它最让我兴奋的地方在于,它把“对齐”从行为层面拉到了表征层面。过去我们只关心模型做什么,RepE 让我们开始关心模型“怎么想”。这种视角转换,可能会启发更多新的对齐方法——比如在训练时直接约束表征方向,而不是等到推理时才干预。

但指望它解决一切对齐问题是不现实的。它的线性假设、分布偏移风险、干预副作用,都还需要大量研究。至少现在,它更像一个强大的研究工具,让我们第一次能够像看心电图一样观察模型的“思想活动”。

下次你用 ChatGPT 时,可以想象一下:在那千亿参数的迷宫深处,有一根看不见的指针,指向“诚实”。而 RepE 教会我们的,正是如何找到这根指针,并轻轻地拨动它。

FAQ

RepE 和对抗性攻击有什么区别?

对抗性攻击通常是通过修改输入来欺骗模型,RepE 是修改模型内部表征来改变行为。一个是“外敌入侵”,一个是“内部调参”。

RepE 会不会让模型变得更危险?

理论上可以。如果恶意用户找到了“有害方向”,他们也能用同样的方法让模型更有害。这是双刃剑。论文作者也强调了透明度研究的双用途问题。

复现 RepE 需要很大的算力吗?

不算大。因为不需要训练,只需要前向传播几次来获取激活,再做简单的线性代数。个人研究者用一张消费级显卡就能复现论文中的大部分实验。

进阶阅读:什么是“线性表征假说”?

简单说,它认为神经网络的内部表征中,概念由线性方向编码,关系由向量平移表示。这个假说最初在词向量中被发现(king – man + woman ≈ queen),后来在视觉模型和语言模型中也得到验证。RepE 依赖这个假说,但并非所有特征都满足线性,这也是它的局限之一。

原创文章,作者:guanweilu,如若转载,请注明出处:https://guanweilu.cn/article/300.html

(0)
上一篇 2026年8月26日
下一篇 2026年8月26日

相关推荐