打开 arXiv,搜「linear attention」「state space model」「beyond Transformer」,你能在一小时内凑齐三百篇声称「暴打 Transformer」的论文。再翻一翻 ChatGPT、Claude、Gemini、Llama 的技术报告,底座全是 Transformer 一家。这种割裂感困扰了我很久:如果替代方案真的更好,为什么最有钱、最需要省算力的工业界纹丝不动?

我最早的答案是「学界激进,业界保守」。后来发现这个答案错得离谱:工业界的工程师比谁都激进,他们只是算过一笔账,发现「换」这个动作本身的代价,远大于省下来的那点算力。
打开 arXiv 是百家争鸣,打开生产环境是铁板一块
先把阵营摆清楚。过去五年,学术界确实端出了不少有分量的替代方案:
| 方案 | 核心思路 | 复杂度 | 代表作 |
|---|---|---|---|
| 线性注意力 | 用核方法或低秩投影近似注意力矩阵 | O(n) | Performer、Linformer |
| 状态空间模型 | 用固定大小的隐状态概括整个历史 | O(n) | S4、Mamba |
| RNN 化改写 | 训练时并行、推理时递推 | O(n) | RWKV |
| 注意力和循环并存 | 两种形态共享参数,按需切换 | O(n) | RetNet |
| 混合架构 | Transformer 层与 SSM 层交替堆叠 | 介于两者之间 | Jamba |
它们共享同一个出发点:注意力要跟历史上每一个 token 两两做内积。读 100 个词,要做 100×100 次「打招呼」;读 10 万个词,就是 100 亿次。替代方案的共同动作,是把「打招呼」改成「记笔记」——用一个固定大小的状态去概括看过的内容,新词只跟笔记对话,不再翻找每一个历史词。
注意「固定大小」这四个字。笔记本就那么大,能写下的细节就那么多。这个限制,后面会变成致命伤。
论文里的 O(n),到了 GPU 上要先打个问号
我一度也天真地以为 O(n) 必然比 O(n²) 快。直到我搞清楚 GPU 是怎么干活的。
GPU 的算力,绝大部分来自 Tensor Core——一堆专门做矩阵乘法的单元。而 Transformer 的注意力,恰恰是好几组巨大的密集矩阵乘法:query 跟 key 相乘,分数跟 value 相乘,每一步都是 GEMM,都能把 Tensor Core 喂得饱饱的。注意力的「平方复杂度」,在硬件眼里反而是最舒服的形状。
状态空间模型呢?它的扫描操作要按序列顺序逐步更新状态:第 t 步的输出依赖第 t-1 步的状态。Mamba 用 parallel scan 做了并行化,但那种并行是层层合并出来的,远不如一条密集矩阵乘法流水线规整。
更关键的是,注意力的显存瓶颈早就被人拆了。2022 年的 FlashAttention 把显存占用从 O(n²) 压到 O(n),工业界在绝大多数场景里从此不用担心注意力「爆显存」。2024 年的论文 The Illusion of State in State-Space Models 又做了一件煞风景的事:把 SSM 和优化过的注意力内核放在同等预算下比较,结论是一大截「线性复杂度优势」被拉平了——所谓 O(n) 快得多,成立的前提是拿朴素的 attention 当对手盘。
换架构不是换辆车,是把整个车队重造一遍
就算速度优势是真的,工业界还是不会换——因为账单长得吓人。
| 环节 | Transformer 已有的 | 换成新架构要做的 |
|---|---|---|
| 训练框架 | Megatron、DeepSpeed、FSDP 全支持 | 张量/流水并行逻辑从零适配 |
| 高效内核 | FlashAttention、FlashInfer 全家桶 | 专属 kernel 基本要重写 |
| 微调工具 | LoRA、QLoRA、PEFT 全家桶 | 按新参数结构重做 |
| 量化推理 | GPTQ、AWQ、FP8 管线成熟 | 新架构的量化策略还停在论文里 |
| 推理服务 | vLLM、TensorRT-LLM 全面兼容 | KV cache 换成 state cache,全部重测 |
这一串下来,换架构的成本是以「几百人·年」计的,收益却只有一个还没经过大规模验证的复杂度优势。算清楚这笔账,任何人都会选择继续压榨手里的 Transformer。
但注意:工业界不是拒绝创新,只是拒绝「推翻一切」的创新。最有说服力的例子是 MoE 混合专家。Mixtral、DeepSeek、Llama 4 都在用 MoE:把 FFN 层复制成多个「专家」,每次只唤醒其中几个,省下一大截算力。attention 结构一个字没改,于是 FlashAttention、vLLM、TensorRT-LLM 全部直接复用。这才叫工业界愿意付费的创新姿势。
工业界最赚钱的任务,恰好是注意力的主场
上面说的是成本,下面说收益——就算替代方案成本为零,纯 SSM 模型也不一定接得了工业界的活。
今天大模型在工业界真正收钱的任务是哪些?RAG 问答、长文档审阅、代码补全、Agent 调工具。它们有个共同特征:精确存取。用户问「第三页第七行那个数字到底是多少」,模型要从 3 万 token 里把原数字抠出来——不是概括,是检索。
注意力机制天生是干这个的:query 跟所有 key 做内积,得分最高的位置就是答案。它是一个内容寻址的精确检索表,可靠、可解释。而 SSM 的固定大小状态是「概括式记忆」:每进来一个新 token,都要把旧状态压一压、揉一揉,给新信息腾地方。概括是它的舒适区,精确回忆是它的命门。学术界对此早有结论:状态空间模型在 associative recall(关联回忆)这类任务上明显落后于注意力。业界踩过的坑也印证了这一点——纯 Mamba 模型做长文档问答,答案总带着一股「差不多但不对劲」的味道。
所以替代方案们面临一个尴尬的错位:它们最强的场景(超长序列流式处理)工业界需求不大;工业界最赚钱的场景(精确检索)它们又恰好不擅长。
我原本以为工业界保守,后来发现他们精明得很
写到这里,你能理解我的认知转变了。我最开始真心觉得,工业界不用 Mamba 是路径依赖、是守旧。后来一查发现,各家不是没试过:TII 发过 Falcon Mamba,AI21 训练了 Jamba——一个 Transformer 层和 Mamba 层交替堆叠的混合模型;NVIDIA、IBM 的研究部门也发表过不少相关实验。
但这些尝试最后收敛到同一个形状:Transformer 为主、SSM 为辅的混合体。没人把赌注押在纯 SSM 上。原因很直白:7B 参数、几千 token 的实验里追平 Transformer,不代表 70B、200k 上下文、峰值负载的真实场景里也站得住,而验证这个结论的代价是以亿计的。
那 Mamba 这类架构到底在哪落地了?
语言模型领域,能数得出来的以研究预览和混合架构为主;真正的生产优势更多在语音、视频这类「天然流式、超长序列」的任务上。大模型圈的务实路线是 Jamba 那样的混合——保留注意力的精确检索,用 SSM 层摊薄长上下文成本。
那能不能用稀疏注意力替代全量注意力?
能,而且工业界已经在做。Mistral 的滑动窗口注意力就是稀疏变体之一。它没有改变注意力机制本身,只是砍掉部分连接——语义没变、工具链没变,所以能被大规模接受。
最后做判断:不是替代,是吸收
回到开头的问题:学术界的替代方案为什么进不了工业界?答案拆三层——复杂度优势在真实硬件上被优化过的注意力内核抵消了大半;换架构的工程成本大到没人愿意独自承担;工业界最赚钱的任务恰好是注意力的主场。三者叠加,替代方案在账面上就输了。
但我不会说「Transformer 永远不可替代」。2017 年之前,也有人对 LSTM 说过同样的话,结果 《Attention Is All You Need》 用注意力把循环架构的统治地位整个掀翻了。这次大概率也会重演:不是替代,是吸收。Jamba 这样的混合架构会继续扩散,SSM 的线性扫描思想会融进新一代注意力变体,但「Transformer 这个壳」会因为生态惯性长期存在。
至于当下的选型建议,我的态度很明确:如果你的场景是 10 万 token 以上、强流式的超长序列处理,混合架构值得认真测;如果只是常规的 RAG、Agent、聊天,别折腾换架构——优化你的 attention kernel 和 KV cache,回报比高一个数量级。
原创文章,作者:guanweilu,如若转载,请注明出处:https://guanweilu.cn/article/507.html