当前的大模型离 AGI 还差什么?推理能力、世界模型、持续学习——三大缺口

AI technology illustration

我见过一个让很多人困惑的场景。

你让 GPT-4 写一篇关于存在主义的哲学论文,它能洋洋洒洒写出 2000 字,结构完整、引经据典。但你让它算 123456 × 7891011,它可能会给你一个完全不对的数字。你告诉它 "Olaf Scholz 是德国第九任总理",问它"德国第九任总理是谁",它能答对;但问它"Olaf Scholz 的职位是什么",它却可能答错。

同一个模型,在复杂任务上像天才,在简单任务上像智障。这种分裂感让一个问题变得格外尖锐:大模型离 AGI(通用人工智能,一个能像人类一样完成任何智力任务的 AI)到底还差什么?

我看了很多论文、跟了很多争论之后,得出一个自己的判断:差在三个根本性的缺口——推理能力、世界模型、持续学习

它不是在推理,它是在"表演推理"

很多人在 ChatGPT 出现后开始相信 AI 会推理。我也曾经这么以为。你看,你让它解一道应用题,它会一步步写:设 x 为……然后代入……最后得出答案。这不是推理是什么?

直到我读到 2023 年那篇著名的论文 The Reversal Curse(逆转诅咒),我的想法被彻底改变了。

训练数据:Olaf Scholz 是德国第九任总理。

问:德国第九任总理是谁?
答:Olaf Scholz。 ✅

问:Olaf Scholz 的职位是什么?
答:(错误或不确定)❌

训练数据里明确写着 "A 是 B",模型学会了 "A → B",却学不会 "B → A"。如果它真的在推理,这种方向上的变换应该是顺理成章的。但模型没有做这件事。

为什么?因为它做的事本质上是记忆中的模式匹配——它记住了 "A 是 B" 这个陈述,却没有提取出 "A 和 B 之间存在某种关系" 这个结构。它的 "推理" 不是通过逻辑规则推导,而是在训练数据里检索最相似的答案模式。

这让我重新审视了 思维链(Chain-of-Thought,CoT)。我原来以为 CoT 是让模型学会 "一步步思考",后来我才想通:CoT 不是推理,而是把一个大问题拆成多个小问题,每一步依然在 "猜",只是每一步猜中的概率更高,总错误率就降低了。

你甚至可以自己做个实验:随便找一道数学题,在题干里加一句无关的话,比如 "顺便说一句,今天下雨了"。很多模型的准确率会骤降。真正的推理者不会被无关信息干扰——但模式匹配器会。

文本里没有世界——语言是世界的"低分辨率照片"

大模型为什么会一本正经地胡说八道?为什么会在物理常识问题上翻车?

答案可能让你意外:大模型从来没有见过世界。它见过的一切,都是文字。而文字是世界的 "低分辨率照片"——保留了大致的轮廓,丢掉了大量物理细节。

比如,你知道 "水往低处流"。这句话在文本里出现了无数次,所以模型能正确说出这句话。但你问它一个更微妙的问题:一个装满水的杯子被推倒,水会怎样流?它可能给你一个看起来合理、但细节完全错误的答案。

因为它没见过水。它不知道水的黏度、重力、杯子倒下的速度——所有你从婴儿时期就积累的物理直觉,它都没有。它只有文字里 "关于水的说法"。

这里有一个我困惑了很久的问题:既然文本包含了大量的世界知识,为什么模型不能从语言中 "悟出" 物理规律?

后来我看到了 Yann LeCun 的解释,一下子想通了。LeCun 在多个场合强调:语言是低带宽的。

一个视频的每一秒可能包含几十万字节的信息,而对应的文字描述只有几十到几百个字节。你让模型只从文本学习,它学到的只是世界的一个高度压缩的投影。—— Yann LeCun 的核心论点

这个观点我一开始觉得过于苛刻,毕竟 GPT-4 确实表现出了惊人的常识。但后来我看到一个物理常识测试:同一个物理问题,换一种措辞,模型的表现就剧烈波动。

这说明什么?说明它学到的不是物理规律,而是语言模式。规律是稳定的,模式是脆弱的。

语言模型
预测下一个词的概率分布。它学到的是词与词之间的统计关联。
世界模型
预测世界状态的变化。它需要因果理解,需要感官输入,需要行动反馈。

LeCun 给出的出路是:真正的世界模型必须能预测未来、理解因果。而因果,恰好是语言模型最不擅长的事。语言里充满了相关性——"昨天下雨了,今天路很滑"——但模型无法区分 "因为" 和 "碰巧"。

你没法让一个已经训练好的模型"临时学点东西"

第三个缺口,是持续学习。

我想先说一个你可能经历过的场景:你在 ChatGPT 里跟它聊了一个小时,你纠正了它的几个错误,它表示 "明白了,以后会注意"。然后你关掉对话,新开一个会话。它把一切都忘了。

这不是 "记忆容量不够",而是架构的问题。大模型在训练完的那一刻就 "冻结" 了。它不会从单次对话中学习,因为学习需要梯度更新,而每次对话都做一次梯度更新,成本高到不现实,而且会引发灾难性遗忘。

灾难性遗忘是机器学习里最老、最顽固的问题之一。早在 1989 年,研究者就发现了:让神经网络学新东西,它会彻底忘掉旧东西。这个过程可以用三步概括:

  1. 模型在任务 A 上训练完毕,参数 w 收敛到 A 的最优解。
  2. 在任务 B 上继续训练,梯度更新把参数 w 推向 B 的最优解。
  3. 因为任务 A 的梯度不再出现,模型为了拟合 B 而大幅调整参数,导致在 A 上的表现断崖式下降。

我曾经以为 "持续学习不就是继续训练吗?"后来我发现这个问题比想象中难得多。难在哪儿?你要让模型在吸收新知识的同时,保持旧知识不丢失,而且新知识还可能与旧知识冲突。

想想人类是怎么做到的。你学会用手机,同时你还记得怎么骑自行车。大脑通过突触的可塑性,在保留旧记忆的同时写入新记忆。但梯度下降天生偏向新数据——新数据的梯度更明确,旧知识被覆盖。

现在有一些缓解方法,比如 LoRA——冻结原始模型,只训练一个小型的附加参数。但 LoRA 也不是 "持续学习",它只是 "在冻结的模型上额外装一个外挂"。你没法让模型学完一个任务再学下一个,同时两个都不忘。

AGI 需要的是能终身学习的架构——模型在部署后,能实时从交互中提取新知识,并更新自己的世界模型。这个目标,当前的主流架构还没有实现。

三个缺口,其实是同一个问题

回到最初的问题:大模型离 AGI 还差什么?

我的判断是:差在三个根本性的能力——

能力 大模型现状 AGI 需要
推理 模式匹配,脆弱的 CoT 可验证、可组合的符号推理
世界模型 文本统计,无物理直觉 因果预测,感官交互
持续学习 训练后冻结,灾难性遗忘 终身学习,实时适应

有意思的是,这三个缺口是相互关联的。没有世界模型,推理就缺少了对象;没有持续学习,世界模型就无法更新;没有推理能力,持续学习就只能学到表面模式。

那 Scale Law(规模定律)能补上这些缺口吗?我的态度很明确:不能。不是因为它不够大,而是因为数据是有限的、语言是稀疏的、统计学习有天花板。你可以把模型做到万亿参数、十万亿参数,它依然是在 "猜下一个词",只是猜得越来越准。

Hinton 说大模型可能已经有了 "理解" 的雏形,LeCun 说大模型永远到不了 AGI。这两个人的争论,本质上是 "统计学的极限" 和 "符号与因果的必要性" 之争。我倾向于 LeCun——不是因为他更悲观,而是因为他指出了大模型结构性缺失的东西,而这些缺失,不是靠堆参数能堆出来的。

AGI 可能需要一个新的架构——一个能像人一样,从稀疏的感官信号中构建世界模型、用符号进行推理、在终身的互动中不断修正自己的架构。大模型是这个未来里重要的一块拼图,但离整张图,还差得很远。

原创文章,作者:guanweilu,如若转载,请注明出处:https://guanweilu.cn/article/236.html

(0)
上一篇 2026年8月21日
下一篇 2026年8月21日

相关推荐