视觉类比推理:对什么——模型能做图形类比吗

先看一道题,一分钟就能做出来。第一格是圆,第二格是三角形,第三格是正方形,第四格该是什么?你几乎不用思考:五边形。太简单了,形状的边数依次加一。

AI technology illustration

人类三岁小孩都能做这种事。但你说这是视觉类比推理的一种最朴素形式——A 对 B 就像 C 对什么,现在把这个任务丢给最先进的视觉模型,结果会让你意外:它在见过的类似图形上能蒙对,可一旦换一种它没见过的组合,准确率直接掉到随机水平。

这事让我困惑了很久。模型不是已经能识别物体、能理解图像了吗?为什么一个简单的图形类比就把它难住了?直到我翻了几篇论文才想通:模型不是在推理,它是在做模式匹配。

瑞文测验:把"类比"变成一道选择题

想严肃地测机器有没有类比推理能力,不能随便找几道脑筋急转弯。认知心理学有一个经典工具——瑞文推理测验。它的题目长这样:一个 3×3 的格子,缺了右下角一块,下面八个候选图,让你挑出该补的那个。每一行、每一列都暗含一个关系规则,比如图形数量变化、位置旋转、属性叠加。

对人类来说,这是衡量抽象推理能力的金标准;对 AI 来说,这是送命题。2018 年,DeepMind 的研究者发布了一个由程序生成的数据集 PGM(Procedurally Generated Matrices),并提出了专门做关系推理的网络 WReN。论文标题很直接:Measuring abstract reasoning in neural networks

结果有多惨?WReN 在完整测试集上的准确率只有 62.8%,而人类经过简单练习能到 89%。但更扎眼的数字藏在细分里:

测试条件 WReN 准确率 人类
训练中见过的规则组合 93.3%
没见过的新规则组合 12.1%(接近瞎猜)

你看,模型不是不行,是它对"见过的东西"记忆得还不错,但一遇到新的组合,就立刻原形毕露。

模型做的是模式匹配,不是推理

我最早以为,只要模型够大、数据够多,它总能从图像里提炼出"边数增加"这种抽象规则。后来看了 RAVEN 数据集的论文才想通——RAVEN: A Dataset for Relational and Analogical Reasoning里,研究者把图形属性分成五种:数量、位置、大小、颜色、类型。他们发现,一个普通的 CNN 只要学会每种属性的视觉模板,就能在训练分布上拿高分。它根本不需要理解"递增",只需要记住"三角形、正方形、五边形对应的像素块长什么样"。

这就是为什么当题目涉及多个属性的交互组合时,模型就崩了。比如要求"根据第一列的属性变化决定第二列的属性变化,再把结果叠加到第三列",这种多级规则它学不会。

这就好比一个学生背熟了九九乘法表,你问他 17 × 3,他一脸茫然。他不是不会乘法,他是把"乘法"理解成了一张查表。

为什么视觉类比这么难?拆开看它需要几步

一个完整的视觉类比推理,至少包含三个环节,缺一不可。

  1. 感知分解:把整幅图拆成独立的属性——形状、颜色、数量、位置。这一步模型做得很好,CNN 就是干这个的。
  2. 关系提取:找出属性之间的变化规律,比如"数量增加 1",或者"形状顺时针旋转 90 度"。这一步已经开始难了,模型需要跨越不同物体的视觉差异看共性。
  3. 关系映射:把从 A→B 学到的规则应用到 C→D 上。这是最核心的一步——你需要理解"变化本身",而不是某个特定的形状或颜色。

目前的神经网络在前两步能做到接近人类,第三步却非常差。原因在于,神经网络默认的归纳偏置是平滑性:相似的输入产生相似的输出。但类比推理要求的是结构性泛化:输入变化很大(比如从圆变成三角形),规则却要不变。

语言模型来凑热闹:向量空间里的"国王 – 男人 + 女人"

既然直接学规则不行,有人想到了另辟蹊径:把视觉类比转成向量运算。word2vec 有一个著名的例子:国王 – 男人 + 女人 ≈ 女王。那么视觉上是不是也有类似的向量方向?CLIP 把图像和文字映射到同一个向量空间,于是有人用 CLIP 做视觉类比:给模型两张图(A 和 B),再给一张目标图 C,让它在图片库中找 D,使得 D 与 C 之间的差异和 B 与 A 之间的差异相近。

听起来很优雅,但实际效果并不好。我曾在一些简单数据集上试过,CLIP 能搞定那些视觉差异很明显、且和语言描述高度对齐的类比,比如"从苹果到香蕉的颜色变化"。但一旦类比涉及形状的抽象变换(比如边数加倍),或者需要多跳逻辑,CLIP 就会给出完全离谱的结果。

原因在于,CLIP 学到的是视觉概念之间的统计共现方向,不是因果关系。它能够告诉你"太阳照片的方向减去月亮照片的方向"大概指向"夜晚",但不明白"为什么"。这种关联在训练数据里丰富时有效,一旦遇到新型关系,它就抓瞎了。

FAQ:几个你可能会问的问题

视觉类比和图像分类有什么本质区别?

图像分类是给单个对象贴标签,而视觉类比是比较两对关系。分类只需要识别"这是什么",类比需要理解"如何变化"。所以一个模型即使分类精度很高,也可能完全做不了类比。

GPT-4V 这类多模态大模型能做图形类比吗?

大模型有强大的语言知识和上下文学习能力,在瑞文测验的简单题目上可以表现不错,但同样会翻车。我见过一个测试,GPT-4V 在面对需要同时考虑多个规则的题目时,经常选择看起来合理的错误答案。它更擅长把题目转换成文字描述然后按文本推理,而不是真正在视觉层面进行结构分析。

既然准确率能到 90%,说它是推理又怎么了?

关键区别在于泛化。一个只会模式匹配的模型,在训练集分布的测试题上可以准确率很高,但稍微改动一下图形类型或关系组合,就跌到随机。推理能力恰恰体现在面对新情况时能迁移规则。所以高准确率不等于推理能力。

那人类为什么能轻易做到?

一个可能的解释是:人类天生就有一种因果推理倾向,我们会自发构建"规则产生图像"的生成模型,然后用假设检验的方式去验证。比如看到一行的图形边数递增,会猜测规律可能是"+1",然后利用这个假设去预测下一格。而神经网络没有这种假设检验机制,它只是在高维空间中做概率匹配。

我的判断:当前视觉模型只能做"看起来像"的类比

想真正突破,目前比较有希望的方向是神经符号方法:先用感知网络提取属性,再用符号规则做可组合的推理。这样模型至少可以在没见过的新组合上泛化。代价是,你通常得手工定义符号和规则,这又回到了传统 AI 的路线。

给你三条实操建议

  • 用数据生成器(如 RAVEN、PGM)测试你的模型,不要用网上攒的零散图片,那样无法控制难度和规则。
  • 当模型在类比任务上出错时,先分析它依赖的是哪种视觉捷径——比如只看颜色而忽略形状。你会发现它学到的特征往往跟你设计的任务逻辑南辕北辙。
  • 如果任务是实际的视觉类比问题,先手工提取属性,再用树搜索或规则推理,比端到端模型稳定得多。

最后回到开头的那个问题:A 对 B 就像 C 对什么?模型可能答得上来,但下一次它碰到一个完全相同的逻辑、不同图形的题时,又会像个失忆的人一样重新开始猜。这就是当前视觉类比推理的真实边界:它没学会规律,只是习惯了场景

原创文章,作者:guanweilu,如若转载,请注明出处:https://guanweilu.cn/article/800.html

(0)
上一篇 2小时前
下一篇 2小时前

相关推荐