第一次看到 ARC-AGI 的题目时,我差点笑出声。一个 3×3 的彩色格子,上面画着几个形状,让你推断下一个输出。这分明是幼儿园的找规律题,哪里称得上 "AGI 基准"?但就是这个看似幼稚的测试,让当今最先进的大语言模型集体翻车。人类轻松能到 80% 以上的正确率,而大多数大语言模型在它上面的得分远低于人类,甚至不如一个 6 岁小孩。直到 2024 年底,OpenAI 专门为它打造了 o3 模型,才拿到了 87.5% 的高分,甚至超过了人类平均水平——但后面我会讲,这个高分里掺了多少水分。

为什么会有这么大的差距?要回答这个问题,得先搞清楚 ARC-AGI 到底在考什么。
一张图看懂 ARC-AGI 的任务形式
ARC-AGI 里每个任务由 3 到 5 个 "示例对" 组成。每个示例对包含一个输入网格和一个输出网格,网格中填着不同颜色的色块。你要做的,是从这些示例对中猜出背后的规则,然后把这个规则应用到一个全新的输入网格上,生成对应的输出。
- 看几个输入输出对,找到规律。
- 用这个规律处理新的输入。
- 生成一个符合规律的输出网格。
规则的类型千奇百怪:颜色映射、形状移动、对称变换、模式复制、逻辑运算…… 每个任务都是独一无二的,测试集中不会出现一模一样的任务。这意味着,AI 无法靠背答案得分。
AI 的软肋:在极少的例子中找规律
你可能已经想到,这需要的不是 "记住",而是 "推理"。深度学习模型在图像分类、语言生成上很强,靠的是从海量数据中提取统计规律。但 ARC 的任务是全新的,模型必须在极少的几个例子中抽象出规则。这正好击中了大模型的软肋。
也许你会反驳:大模型不是能解数学题、写代码吗?但那些能力本质上还是从训练数据中学来的。ARC 的设计哲学是:真正的智能必须能在从未见过的任务上,用极少的例子,即时进行抽象。这恰恰是大模型最不擅长的事情。
- 深度学习是统计学习,需要大量数据才能学到规律,而 ARC 每个任务只有 3-5 个示例,统计规律根本不存在。
- 语言模型以预测下一个 token 为目标,擅长从已知模式中检索,而不是在新场景中推理。
- ARC 的输入是原始像素网格,没有自然语言描述,模型无法借助语言知识。
「智能不是一个系统已经掌握的技能,而是它获取新技能的速度和效率。」
—— François Chollet《On the Measure of Intelligence》
人类不需要大模型,只需要几百万年的进化
人类做 ARC 时,靠的不是计算,而是直觉。我们天生会把网格中连续同色的区域看成一个 "物体",天生理解 "上面" "下面" "旁边",天生能识别对称、旋转和颜色变化。这些能力在婴儿时期就已存在,是进化留给我们的核心知识。心理学家把这种能力叫做 "流体智力",它和从经验中积累的 "晶体智力" 是两种不同的东西。ARC-AGI 测的,正是流体智力。
ARC 的题目正是基于这些人类核心知识设计的。所以对人来说,这些题是 "直觉",对 AI 来说,是 "天书"。
举个例子,有个任务是这样:输入网格里有两个形状,输出是它们重叠的部分。人类一眼就能看出 "重叠区域",但 AI 需要先理解什么是 "形状"、什么是 "重叠",这本身就是两个抽象概念。
o3 的 87.5%,是真实力还是暴力搜索?
2024 年 12 月,OpenAI 宣布 o3 模型在 ARC-AGI 上拿下了 87.5% 的分数,首次超过了人类平均水平。但注意,这是在 "高计算模式" 下的成绩;在低计算模式下,它的得分只有 75.7%。François Chollet 本人随即在官方博客上回应:o3 的成功主要靠的是 "测试时计算"——在推理阶段消耗巨大的计算资源进行程序搜索。换句话说,o3 不是靠抽象推理,而是靠枚举各种可能的规则,看哪个能解释所有示例。
| 维度 | 人类 | o3 |
|---|---|---|
| 示例数量 | 3-5 个 | 3-5 个 |
| 解题速度 | 秒级 | 分钟到小时级 |
| 计算消耗 | 约 20 瓦 | 大量 GPU |
| 核心方法 | 直觉 + 抽象 | 大规模搜索 + 模式匹配 |
ARC-AGI 不是银弹,但它是块试金石
当然,ARC-AGI 并不完美。它只覆盖了视觉抽象推理这一种智能维度,不涉及语言、社交、规划。Chollet 自己也承认,ARC 是通用智能的必要条件,而不是充分条件。
但也有研究者指出,ARC 的规则空间其实有限,只要设计足够大的搜索空间,也能用暴力搜索拿到高分,这并不能证明模型真的理解了规则。也就是说,o3 的高分,恰恰暴露了当前 AI 在 "泛化" 上的本质弱点。
我最早以为 ARC-AGI 只是一个用来炫技的玩具基准。直到我尝试用大模型去解 ARC 题目,才发现它难得出奇。我手动给模型提供几个示例,让它生成新网格,它输出的结果几乎都是错的,而且是完全离谱的错误——比如把颜色乱填、把形状打乱。那一刻我才明白,语言模型对 "颜色" 和 "位置" 这些概念,真的只是字符层面的理解,没有任何空间感。
所以,下一次你看到某个 AI 在某个测试中拿了高分,不妨先问一句:它花了多少计算?它能不能举一反三?如果答案是需要几万美元的电费和无数次的尝试,那么它可能只是找到了一个聪明的搜索方法,而不是真的变聪明了。
原创文章,作者:guanweilu,如若转载,请注明出处:https://guanweilu.cn/article/252.html