有一类问题,人类觉得简单到不值得回答,模型却会一本正经地给出荒谬答案——还附赠一段听起来很有道理的解释。桌上立着一只玻璃杯,里面半杯水。把照片给模型看,然后问它:如果把这个杯子向右推倒,水会往哪边洒?

提示词:「照片里的玻璃杯装了半杯水,放在桌面上。如果把这个杯子向右推倒,水会往哪个方向洒?」
一次典型的失败回答(我揉合了几个模型的输出,画风就是如此):「水会垂直落到桌面上。水是液体,在重力作用下总是沿着竖直方向向下流动,所以洒出的水会直接落在杯子正下方。」
乍一听没毛病——水确实受重力。但你仔细想:杯子向右倒下的瞬间,杯口是倾斜的,水是先水平冲出杯口、划出一道抛物线、落到右侧,而不是像一坨果冻一样垂直掉回正下方。模型把一个课本结论「水往低处流」,当成了对具体事件的预测。
正常人完成这个判断只需要零点几秒:先推算杯子的倾斜方向,再调用对重力、惯性和液体行为的认知,在脑子里把整个过程预演一遍。这句话看起来是生活常识,实际上是一道「空间几何+物理定律」的两步推理题。学术圈把它拆成两半:视觉空间推理判断「杯子在桌面上、杯口朝上」,视觉物理推理预测「推倒之后会发生什么」。而你问模型的那句话,恰好踩在两个领域的交界处。
四代基准测试,把模型从「会」考到「不会」
我最早以为这种问题对模型来说不难——训练数据里肯定有海量杯子的照片,模型「见过」无数只杯子。后来我去翻了评测论文,才发现一个反直觉的事实:模型见过杯子,但它不知道杯子会倒。
2017 年,CLEVR 用合成 3D 场景考物体识别、计数和位置关系,模型刷到接近满分。2020 年,CLEVRER 把场景从静态变成动态,加入碰撞和「如果当初……会怎样」的反事实问题,模型在反事实上大幅落后。2022 年,VSR 用真实世界视频考空间关系判断,最好的系统只有大约 60% 的正确率,人类是 94.5%。同一年,Physion 让模型预测真实视频里的物理结果,人类平均八成五左右,最强模型只有五成多。2024 年的 PhysBench 把一批一线视觉语言模型拉进同一考场,整体准确率依然只有五成上下。
| 基准 | 场景 | 考什么 | 模型表现 |
|---|---|---|---|
| CLEVR(2017) | 合成 3D | 颜色、形状、数量、位置 | 训练后可接近满分 |
| CLEVRER(2020) | 合成 3D 动态 | 碰撞事件、预测、反事实 | 反事实问题大幅落后 |
| VSR(2022) | 真实视频 | 空间关系判断 | 约 60%,人类 94.5% |
| Physion(2022) | 真实视频 | 物理结果预测(含流体) | 约五成多,人类约八成五 |
| PhysBench(2024) | 多模态综合 | 物理世界理解 | 一线模型约五成 |
趋势很清楚:从「认东西」到「懂物理」,难度不是爬坡,是跳崖。而且后续分析发现,模型在 CLEVR 上的高分里有很多捷径成分——它学的是颜色和位置的统计关联,而不是可组合的逻辑规则。
模型根本没在「看」:它只是预测下一个 token
这个问题让我卡了很久。模型不是会处理图像吗?物体识别、场景理解不是挺强的吗?怎么连杯子倒水都推不出来?
直到我意识到一个被我忽略的事实:所谓「看」,在视觉语言模型里根本不是一个三维的过程。它实际做的是:
- 图像被切成一块块方形 patch,每块 patch 对应一个向量。
- 这些向量和文字 token 混在一起,送进 Transformer。
- 注意力机制在 patch 与 token 之间互相打分、加权融合。
- 最后按概率分布,生成下一个词。
从头到尾,模型面对的不是一个立体的世界,而是一串扁平的数字。它没有重建物体的三维几何,没有计算重力、惯性和摩擦。它只在做它最擅长的一件事:预测下一个 token。
说人话:模型像一个读了一百本物理课本、但从没进过实验室的书呆子。你问它「水往哪边流」,它翻遍记忆里的句子模式,拼出一个读起来顺口的答案。至于这个答案在现实里成不成立,它没有能力验证——也没机会验证,因为它从来没有见过真实的水。
- 陈述性知识
- 关于世界的描述:「水受重力作用往低处流」。
- 模拟性知识
- 在脑子里预演过程的能力:想象杯子倾倒、水面倾斜、水沿杯口溢出的连续画面。
人类做这道题靠的是第二种,模型只有第一种。这不是量的差距,是质的差距。
婴儿天生就会的,模型后天学不会
那模型的物理知识到底从哪来?答案有点尴尬:从文字里「听来」的。
视觉语言模型的训练数据,主体是「图像+说明文字」的配对。图片里杯子是静止摆放的,文字写的是「桌上的玻璃杯」。模型知道杯子长什么样、通常出现在哪,但「推倒杯子会发生什么」这件事,在静态图文里几乎不存在。它学到的是一套关于物理的传说,而不是物理本身。
人类和模型在这里有一个根本性区别。发展心理学里有一个著名的「违反预期」实验:半岁左右的婴儿,已经会对「一块实心积木穿过另一块实心积木」这种不可能事件表现出更长时间的注视。婴儿没被训练过物理题,却天生带着一套「直觉物理」引擎。
模型的引擎是后装的,而且不是一个整体——是由无数条文本统计规律拼出来的应急方案。这就是为什么模型在熟悉场景上偶尔灵光,换个角度、加个遮挡物、改个物体形状,就迅速失灵。
多喂点数据,模型能学会吗?
数据再多,也只是更多的「听说」。文本和图注不会记录力的传导过程。这也是为什么视频预训练确实有点效果,但进展远不如预期——模型的物理准确率会随规模上升,可那条上升曲线与人类的理解是两回事。
为什么答错了还那么自信?
因为训练目标是「接得顺」,不是「答得对」。模型对每个 token 都有高置信度,但那是语言流畅性的置信度,不是事实正确性的置信度。它输出的每个字之间很连贯,和现实之间却没有连接。
给模型配个物理模拟器不就行了?
技术上可行,研究者已经在做,比如 DeepMind 的图网络模拟器能精确预测流体飞溅。但这本质上是「作弊」——模型自己不模拟,而是把问题翻译给外部工具去算。这种系统能干活,恰恰反证了模型自身没有长出世界模型。
杯子倒下的那一刻,答案不在训练数据里
现在说我的判断。当前视觉语言模型的物理推理,处在「能背常识、碰不了新局面」的阶段。什么时候会失效?场景越新、越反常规、需要越多步因果判断,它崩得越快。反事实问题是试金石——「如果杯子底下垫了块石头,水会怎么洒?」模型几乎没有确定性。
这里还有一个更麻烦的结构性问题。物理模拟器需要结构化的状态输入(物体的位置、速度、形状),视觉模型只能输出文字。从像素到物理状态之间的这一步,是当前 AI 最大的黑洞。Yann LeCun 在他的世界模型论纲里反复强调:如果 AI 要走进真实世界、去操作机器人和汽车,它内部必须有一个能预测未来的世界模型,而不是在语言分布里捞答案。
图网络模拟器是怎么做到精确预测流体的?
它把物体建模成节点、把相互作用建模成边,用图神经网络反复执行「感知状态 → 更新隐状态 → 预测下一帧」的循环。问题在于,它需要干净的物理状态作为输入,而不是一张照片。换句话说,它是个很好的「身体」,但没有自己的「眼睛」。
回到那杯水。杯子倒下的那一刻,水往哪边流,答案从来不在某段训练文本里,而是在物理定律里。
模型什么时候能说出这句话,而不只是背出这句话,它才算真的「看见」了世界。
原创文章,作者:guanweilu,如若转载,请注明出处:https://guanweilu.cn/article/780.html