2023 年,OpenAI 的 CEO Sam Altman 说,AGI 可能在未来十年内到来。同一年,Meta 的首席 AI 科学家 Yann LeCun 说,现有的大模型连猫都不如。两个都是这个星球上最懂 AI 的人,预言却像来自两个时代。你可能会想:总有一个在胡说吧?

我把两边都认真读了一遍,发现一个有意思的事情:他们讨论的根本不是一个东西。
AGI 的定义:一个词,两种用法
先说最反直觉的一点:AGI 这个词没有统一标准。OpenAI 的章程里把 AGI 定义为“在最具经济价值的工作中胜过人类的高度自主系统”。OpenAI Charter 注意,它强调的是“经济价值”和“胜过人类”,而不是“像人一样思考”。
而 LeCun 和 Gary Marcus 这批人,心里的 AGI 是另一回事。他们要求机器有世界模型、有因果理解、能持续学习,像哺乳动物一样灵活适应环境。这根本不是同一个目标。
2023 年有一篇论文专门梳理了 AGI 的层级,把 AGI 分为 Level 0 到 Level 5:Levels of AGI
- Level 0:无 AI,纯人
- Level 1:涌现的 AGI,能跟人类匹敌
- Level 2:有能力的 AGI,在 90% 的经济任务中超越人类
- Level 3:专家 AGI,在特定领域超越所有人类
- Level 4:大师级 AGI,在大多数领域超越 90% 的人类
- Level 5:超人级 AGI,在几乎所有任务上超越所有人类
你看,光是“AGI 快到了”这句话,在 Level 1 和 Level 2 之间就有巨大差别。所以当 Sam Altman 说“十年内”,他指的可能是 Level 1;而当 LeCun 说“还远”,他可能是在说 Level 4 甚至 Level 5。
乐观派凭什么说“快到了”
乐观派的底气来自一条经验规律:缩放定律。2020 年 OpenAI 的论文发现,语言模型的性能随着参数量、数据量、计算量的增加,呈幂律稳定提升。Scaling Laws for Neural Language Models 意思是,只要愿意砸钱,loss 几乎是可以预测的。之后的 GPT-3、GPT-4、Claude 系列,基本沿着这条曲线走。
更让人兴奋的是“涌现”现象。2022 年一篇论文统计了各种大模型,发现某些能力(比如算术、代码生成、多步推理)在小模型上几乎为零,但规模超过某个阈值后,性能突然飙升。Emergent Abilities of Large Language Models 这看起来就像是“能力从量变到质变”。
不过,2023 年有一篇论文给这种兴奋泼了冷水。作者发现,所谓的“涌现”可能只是你选择的评估指标的副作用——当你用准确率这种非连续指标来测量时,小模型的能力看起来是零,一旦超过某个阈值就跳到非零。但如果你用损失函数或连续指标来测量,能力提升其实是一条平滑曲线。Are Emergent Abilities a Mirage? 换句话说,不是模型突然开窍了,而是我们的尺子不够细。
所以乐观派的逻辑仍然成立:曲线还在上升,能力还在冒出来,按这个趋势,AGI 就在眼前。
悲观派凭什么说“还很远”
悲观派的核心反驳是:你测量的东西可能根本不通向 AGI。Gary Marcus 在《The False Promise of AGI》里说得很明白:大模型本质上是在做“模式匹配”,它没有连贯的世界模型,碰到分布外的输入就会崩溃。The False Promise of AGI
举个大家都见过的例子:问 GPT-4“9.11 和 9.8 哪个大”,它可能一本正经地告诉你 9.11 大。不是它笨,而是它根本没有“数轴”的概念,它只是在字符序列里找概率规律。类似的问题在常识推理、物理直觉、多步规划上频繁翻车。
另一个常被引用的证据是 ARC-AGI 基准——一个专门设计用来衡量通用智能的测试,需要从少量样例中抽象出规律并应用到新图形上。人类能轻松拿到 80% 以上的正确率,而目前最好的大模型也才刚过 30%。ARC Prize 这说明,在需要真正“举一反三”的任务上,大模型还差得远。
LeCun 更进一步:他认为纯语言训练永远无法产生真正的智能,因为语言只是人类认知的冰山一角。他主张让 AI 学习世界的预测模型——就像婴儿一样,通过观察和互动来理解物理规律。这条路现在连雏形都谈不上。
为什么两个说法都可能对
我最早也被这种争论搞得很困惑。后来我想通了一个类比:自动驾驶。如果你把“驾驶”定义为“在固定测试道路上开”,那自动驾驶十年前就实现了。如果你定义为“在任何天气、任何城市、任何突发状况下像人一样安全驾驶”,那今天还没实现。AGI 也是一样,你定义什么,就得到什么。
用一张表来说清楚两边的分歧:
| 乐观派视角 | 悲观派视角 | |
|---|---|---|
| 核心目标 | 在重要任务上超越人类 | 具备人类级别的通用认知 |
| 代表证据 | 代码、翻译、图像生成已接近人类 | 常识推理、物理直觉、持续学习仍远不及人类 |
| 判断标准 | 任务完成度(经济价值) | 认知机制(世界模型、因果) |
| 预测 AGI 时间 | 10 年内 | 可能几十年或永远 |
所以“AGI 快到了”和“AGI 还很远”根本不是互相矛盾的陈述,而是对两个不同问题的回答。
我的判断:边界在哪
在我看来,现在的模型确实在朝着“经济意义上的 AGI”快速逼近。你让一个 LLM 写代码、做数据分析、写邮件,它已经能完成相当一部分白领工作,而且成本还在指数下降。按 OpenAI 的定义,这些就是“最具经济价值的工作”,所以 AGI 快到了不是空话。
但如果你要的是“像人一样理解世界”的 AGI,那还差得远。当前模型的致命弱点是:没有持续学习能力——训练完就冻结,无法像人一样从一次经历中学会新技能;没有可靠的因果推理——它分不清相关和因果;没有真正的目标感——它只是在做概率生成。这些都不是堆数据能解决的。
所以我的结论是:AGI 快到了,如果你要的是能干活的经济机器;AGI 还很远,如果你要的是能理解世界的智慧生命。两个说法都成立,只是很多人把这两件事混成了一件事。
原创文章,作者:guanweilu,如若转载,请注明出处:https://guanweilu.cn/article/246.html