你让 AI 生成一段视频:一个苹果从桌上掉下来。结果你看到了什么?苹果在空中悬停了半秒,然后垂直掉下去,但速度没有变化,像被一根看不见的线吊着。你又试了一次:把杯子推到桌边,杯子应该翻倒落地,但 AI 给的结果是杯子穿过桌面,沉了下去。你皱皱眉,得出一个结论:这 AI 不懂物理。

我最早也是这样想的。但后来我看了 OpenAI 的 Sora 技术报告,又翻了一些评论,发现自己错怪它了。它并不是不懂物理,而是它学的数据里,压根就没有"物理"这个东西。
一个悬浮的苹果
我们先说说视频生成模型是怎么工作的。以 Sora 为代表,它做的事情是:给你一段文字提示,然后逐帧生成图像。每一帧的每个像素,都是模型根据前面所有帧和文本条件,从概率分布里抽出来的。说白了,模型就是一个超级强大的"像素预测器"。
你可能会问:像素预测器为什么能生成出连贯的动作?因为它见过大量的视频。在那些视频里,苹果通常是从桌上掉下来,而不是悬浮在空中。所以模型学到的规则是:"苹果和桌面接触时,大概率往下移动"。这是一个统计规律,不是一个物理定律。
但统计规律和物理定律的区别在关键时刻就会暴露。你让模型生成一个苹果从桌上掉下来,它可能生成一个很流畅的下落过程,因为它见过无数类似片段。可一旦你让模型生成一个篮球砸到弹珠上,或者一杯水倒在一个滑板上,这种组合在训练数据里可能很少见,模型就没有可参照的统计规律。于是它就开始"自由发挥",而自由发挥的结果就是出现违反物理的诡异画面。
像素背后没有力
我们来拆解一下"物理"在视频数据里是什么样子。
物理规律不是可以直接看到的。你看到苹果下落,但你看到的是苹果的位置随时间变化,你看不到"重力"这个力。你看到球撞墙后反弹,但你看到的是球的速度和方向突然改变,你看不到"弹性碰撞"背后的动量守恒。视频数据里只有像素的光影变化,物理规律是隐藏在背后的"生成过程"。
模型要从数据中学习这个生成过程,本来也有可能。但这里有个巨大的障碍:当前的 Transformer 架构并没有内置"物理因果"的归纳偏置。它学到的相关性,是统计层面的相关性。比如它知道"球和墙接近到一定程度后,球会反向运动",但它不知道"墙是坚硬的,球被弹开是因为动量守恒"。这就像一个人只看过几百部魔术表演,他学会了魔术的套路,但他不知道魔术师背后的机关。
所以,模型学到的物理,其实是一堆"看起来像物理"的统计规则:
- 物体通常不会凭空消失,所以模型会尽量避免让物体瞬间消失。
- 物体通常不会穿过其他物体,所以模型会在大部分时候避免穿模。
- 物体通常受到重力影响,所以模型会让大多数物体向下运动。
这些规则能应付日常场景,但一旦你给它一个需要精确物理计算的场景,它就崩了。因为"通常不会"不等于"不会"。它没有因果逻辑来保证"一定不会"。
人类 vs 模型:物理直觉从哪来?
我们人类是怎么理解物理的?从出生开始,我们就用手抓东西,感受物体的重量、质感;我们推东西,感受阻力;我们摔倒,感受重力。这些体验形成了因果模型,我们不需要看一万个苹果下落的视频,只要摔几次,就知道苹果掉下来会碎。
视频生成模型没有身体,它唯一的输入是像素。它没有"感受"的能力。所以哪怕你给它看一百万个苹果下落的视频,它学到的依然是"苹果下落"这个像素序列的概率,而不是"苹果因为重力而下落"这个因果关系。下面这个表格可以看清两者的差异:
| 维度 | 人类婴儿 | 视频生成模型 |
|---|---|---|
| 物理知识来源 | 身体与环境的主动互动 | 被动观看视频像素 |
| 是否有因果模型 | 有,能理解"力"和"作用" | 没有,只有统计相关 |
| 物体恒存性 | 天生具备(或通过触摸习得) | 通过数据统计模仿,不稳定 |
| 面对新场景 | 能用已有物理直觉推理 | 依赖训练数据覆盖度 |
Yann LeCun 曾经评论过 Sora,说它并不是世界模型,而是像素生成模型。他在接受采访时说:
"They have no idea about the world."
他建议研究者应该考虑让模型在虚拟环境中主动探索,通过与环境的互动来学习物理规律。我同意这个方向。只有让模型"动手"操作物体,它才能真正建立因果模型,而不是停留在像素统计。
能不能给模型装一个物理引擎?
有人会想,既然模型学不会物理,那我们直接把物理规律写死,或者在后处理时加一个物理引擎,是不是就解决了?
这个思路有一定道理。目前很多视频生成工具确实会加一些约束,比如保证人脸不变形、手指数目正常,但物理引擎直接介入视频生成还非常困难。原因是:物理引擎需要知道场景中每个物体的质量、速度、材料、初始条件,而模型从像素中根本提取不出这些信息。你给模型一段视频,它不知道哪个像素是杯子,哪个是手,更不知道它们的质量比。
反过来,也有研究者尝试把物理规律作为损失函数的一部分,让模型在训练时被约束。但这个方向还在实验室阶段,离实用很远。目前最有效的办法,反而是"靠数据凑":把训练数据里加入更多物理正确的视频,让模型在统计上更少犯错。但这也只能缓解,不能根治。
几个你可能会问的问题
是不是模型规模再大一点,物理错误就会消失?
不会。模型规模增大可以更好地记忆数据分布,但无法超越数据本身。如果训练数据里没有"水洒在地上会渗透、蒸发"的物理过程,模型再大也编不出来。规模只能让它在见过的场景里更流畅,不能让它理解没见过的物理。
加入 3D 数据能不能解决?
有帮助,但有限。3D 数据可以让模型学到更多几何关系,但物理本质是力与运动的关系,3D 几何只是其中一部分。物体之间的碰撞、摩擦、形变,仍然需要建模。
视频生成模型有没有可能在某个物理子领域达到人类水平?
有可能,如果该领域的物理过程在数据中足够常见且规则简单。比如球的抛物线运动,模型可以学得很好。但复杂流体、多物体耦合这些场景,短期内很难。
回到开头的问题:视频生成模型容易出物理错误,根源不是它"不懂物理",而是"训练数据里没有物理"。数据里只有物理现象的投影,没有物理本身。模型从投影中学到的是统计规律,不是因果规律。它生成视频的过程,本质上是在"模拟一个模拟",而不是在"运行一个世界"。
当前的能力边界在哪?在常见的、大量出现过的场景里,它表现得像懂物理;在罕见组合、复杂交互、多物体动力学上,它会一塌糊涂。它永远不可能通过"看视频"真正理解物理,除非我们改变训练范式——让它像婴儿一样动手探索,或者在架构上注入物理先验。
这不仅是技术问题,也是哲学问题:如果 AI 只能从数据中学习,那么它永远无法理解数据之外的真实。而物理,恰恰是那个"数据之外"的东西。也许,这就是视频生成模型给我们上的最重要的一课。
原创文章,作者:guanweilu,如若转载,请注明出处:https://guanweilu.cn/article/210.html