为什么学术界不断提出 Transformer 替代方案,工业界却几乎都用 Transformer?

打开 arXiv,搜「linear attention」「state space model」「beyond Transformer」,你能在一小时内凑齐三百篇声称「暴打 Transformer」的论文。再翻一翻 ChatGPT、Claude、Gemini、Llama 的技术报告,底座全是 Transformer 一家。这种割裂感困扰了我很久:如果替代方案真的更好,为什么最有钱、最需要省算力的工业界纹丝不动?

AI technology illustration

我最早的答案是「学界激进,业界保守」。后来发现这个答案错得离谱:工业界的工程师比谁都激进,他们只是算过一笔账,发现「换」这个动作本身的代价,远大于省下来的那点算力。

打开 arXiv 是百家争鸣,打开生产环境是铁板一块

先把阵营摆清楚。过去五年,学术界确实端出了不少有分量的替代方案:

方案 核心思路 复杂度 代表作
线性注意力 用核方法或低秩投影近似注意力矩阵 O(n) Performer、Linformer
状态空间模型 用固定大小的隐状态概括整个历史 O(n) S4、Mamba
RNN 化改写 训练时并行、推理时递推 O(n) RWKV
注意力和循环并存 两种形态共享参数,按需切换 O(n) RetNet
混合架构 Transformer 层与 SSM 层交替堆叠 介于两者之间 Jamba

它们共享同一个出发点:注意力要跟历史上每一个 token 两两做内积。读 100 个词,要做 100×100 次「打招呼」;读 10 万个词,就是 100 亿次。替代方案的共同动作,是把「打招呼」改成「记笔记」——用一个固定大小的状态去概括看过的内容,新词只跟笔记对话,不再翻找每一个历史词。

注意「固定大小」这四个字。笔记本就那么大,能写下的细节就那么多。这个限制,后面会变成致命伤。

论文里的 O(n),到了 GPU 上要先打个问号

我一度也天真地以为 O(n) 必然比 O(n²) 快。直到我搞清楚 GPU 是怎么干活的。

GPU 的算力,绝大部分来自 Tensor Core——一堆专门做矩阵乘法的单元。而 Transformer 的注意力,恰恰是好几组巨大的密集矩阵乘法:query 跟 key 相乘,分数跟 value 相乘,每一步都是 GEMM,都能把 Tensor Core 喂得饱饱的。注意力的「平方复杂度」,在硬件眼里反而是最舒服的形状。

状态空间模型呢?它的扫描操作要按序列顺序逐步更新状态:第 t 步的输出依赖第 t-1 步的状态。Mamba 用 parallel scan 做了并行化,但那种并行是层层合并出来的,远不如一条密集矩阵乘法流水线规整。

更关键的是,注意力的显存瓶颈早就被人拆了。2022 年的 FlashAttention 把显存占用从 O(n²) 压到 O(n),工业界在绝大多数场景里从此不用担心注意力「爆显存」。2024 年的论文 The Illusion of State in State-Space Models 又做了一件煞风景的事:把 SSM 和优化过的注意力内核放在同等预算下比较,结论是一大截「线性复杂度优势」被拉平了——所谓 O(n) 快得多,成立的前提是拿朴素的 attention 当对手盘。

换架构不是换辆车,是把整个车队重造一遍

就算速度优势是真的,工业界还是不会换——因为账单长得吓人。

环节 Transformer 已有的 换成新架构要做的
训练框架 Megatron、DeepSpeed、FSDP 全支持 张量/流水并行逻辑从零适配
高效内核 FlashAttention、FlashInfer 全家桶 专属 kernel 基本要重写
微调工具 LoRA、QLoRA、PEFT 全家桶 按新参数结构重做
量化推理 GPTQ、AWQ、FP8 管线成熟 新架构的量化策略还停在论文里
推理服务 vLLM、TensorRT-LLM 全面兼容 KV cache 换成 state cache,全部重测

这一串下来,换架构的成本是以「几百人·年」计的,收益却只有一个还没经过大规模验证的复杂度优势。算清楚这笔账,任何人都会选择继续压榨手里的 Transformer。

但注意:工业界不是拒绝创新,只是拒绝「推翻一切」的创新。最有说服力的例子是 MoE 混合专家。Mixtral、DeepSeek、Llama 4 都在用 MoE:把 FFN 层复制成多个「专家」,每次只唤醒其中几个,省下一大截算力。attention 结构一个字没改,于是 FlashAttention、vLLM、TensorRT-LLM 全部直接复用。这才叫工业界愿意付费的创新姿势。

工业界最赚钱的任务,恰好是注意力的主场

上面说的是成本,下面说收益——就算替代方案成本为零,纯 SSM 模型也不一定接得了工业界的活。

今天大模型在工业界真正收钱的任务是哪些?RAG 问答、长文档审阅、代码补全、Agent 调工具。它们有个共同特征:精确存取。用户问「第三页第七行那个数字到底是多少」,模型要从 3 万 token 里把原数字抠出来——不是概括,是检索。

注意力机制天生是干这个的:query 跟所有 key 做内积,得分最高的位置就是答案。它是一个内容寻址的精确检索表,可靠、可解释。而 SSM 的固定大小状态是「概括式记忆」:每进来一个新 token,都要把旧状态压一压、揉一揉,给新信息腾地方。概括是它的舒适区,精确回忆是它的命门。学术界对此早有结论:状态空间模型在 associative recall(关联回忆)这类任务上明显落后于注意力。业界踩过的坑也印证了这一点——纯 Mamba 模型做长文档问答,答案总带着一股「差不多但不对劲」的味道。

所以替代方案们面临一个尴尬的错位:它们最强的场景(超长序列流式处理)工业界需求不大;工业界最赚钱的场景(精确检索)它们又恰好不擅长。

我原本以为工业界保守,后来发现他们精明得很

写到这里,你能理解我的认知转变了。我最开始真心觉得,工业界不用 Mamba 是路径依赖、是守旧。后来一查发现,各家不是没试过:TII 发过 Falcon Mamba,AI21 训练了 Jamba——一个 Transformer 层和 Mamba 层交替堆叠的混合模型;NVIDIA、IBM 的研究部门也发表过不少相关实验。

但这些尝试最后收敛到同一个形状:Transformer 为主、SSM 为辅的混合体。没人把赌注押在纯 SSM 上。原因很直白:7B 参数、几千 token 的实验里追平 Transformer,不代表 70B、200k 上下文、峰值负载的真实场景里也站得住,而验证这个结论的代价是以亿计的。

那 Mamba 这类架构到底在哪落地了?

语言模型领域,能数得出来的以研究预览和混合架构为主;真正的生产优势更多在语音、视频这类「天然流式、超长序列」的任务上。大模型圈的务实路线是 Jamba 那样的混合——保留注意力的精确检索,用 SSM 层摊薄长上下文成本。

那能不能用稀疏注意力替代全量注意力?

能,而且工业界已经在做。Mistral 的滑动窗口注意力就是稀疏变体之一。它没有改变注意力机制本身,只是砍掉部分连接——语义没变、工具链没变,所以能被大规模接受。

最后做判断:不是替代,是吸收

回到开头的问题:学术界的替代方案为什么进不了工业界?答案拆三层——复杂度优势在真实硬件上被优化过的注意力内核抵消了大半;换架构的工程成本大到没人愿意独自承担;工业界最赚钱的任务恰好是注意力的主场。三者叠加,替代方案在账面上就输了。

但我不会说「Transformer 永远不可替代」。2017 年之前,也有人对 LSTM 说过同样的话,结果 《Attention Is All You Need》 用注意力把循环架构的统治地位整个掀翻了。这次大概率也会重演:不是替代,是吸收。Jamba 这样的混合架构会继续扩散,SSM 的线性扫描思想会融进新一代注意力变体,但「Transformer 这个壳」会因为生态惯性长期存在。

至于当下的选型建议,我的态度很明确:如果你的场景是 10 万 token 以上、强流式的超长序列处理,混合架构值得认真测;如果只是常规的 RAG、Agent、聊天,别折腾换架构——优化你的 attention kernel 和 KV cache,回报比高一个数量级。

原创文章,作者:guanweilu,如若转载,请注明出处:https://guanweilu.cn/article/507.html

(0)
上一篇 3天前
下一篇 2天前

相关推荐