图像描述中的幻觉问题:图里没有自行车,模型却说「一个人骑着自行车」

我最早以为,图像描述模型是“看着图片说话”的。结果有一次,我给它看一张湖边木屋的照片,模型竟然说“一只狗在门口睡觉”。照片里根本没有狗。这个错误让我又好笑又警觉——一个能把构图、光线、色调都讲清楚的模型,为什么会在一个自己“看”了半天的地方犯这么荒谬的错?

AI technology illustration

其实,模型从来不是在“看”图片。它只是一个概率机器。要理解这一点,得先搞懂图像描述模型的标准架构。

目前主流的视觉语言模型(比如 LLaVA)由两个部分组成:视觉编码器和语言解码器。视觉编码器(通常是 ViT 或 CLIP)把图片切成几十个小方块,每个方块变成一个向量,整张图变成一串向量。语言解码器则按照自回归方式,一个词一个词地生成描述。每生成一个词,它都要算一遍:给定视觉特征和前面已经生成的词,词汇表里每个词的概率是多少,然后挑概率最高的输出。

这里的关键在于:模型生成“狗”这个词时,不是在报告“我看到了一只狗”,而是在做一个下注——它觉得这个位置出现“狗”这个词,从统计上看最合理。整个过程里,没有任何一步会反过去检查图片里是不是真的有个物体叫“狗”。

那这份“统计上的合理”从哪来?一部分来自图片的视觉证据,另一部分来自模型在几十亿条图文数据里学到的语言搭配习惯。问题恰恰出在这两者的博弈上。

当图片里的视觉证据足够强,比如一只大狗占了画面一半,模型会倾向于说“狗”。但视觉证据是会被稀释的。视觉编码器会把一张512×512的图压缩成很小的向量集合,一个占了十几个像素的小物体,它的特征在空间维度上可能被彻底湮没。这时,语言先验就会接管——模型在训练数据里见过太多次“房子-门口-狗”同时出现,只要图像里出现了房子和门,它就会把“狗”这个词给补完。

更隐蔽的是训练数据本身的偏差。图像描述数据集大多是众包生产的,标注者写描述时,习惯把显眼的大物体写上去,而忽略角落里的小物件。模型不知道这是人的习惯,它只会认为:这些大物体出现时,描述里就该包含这些词汇。于是,它对常见大物体过拟合,对罕见小物体却容易无中生有。

我原来一直想不通:为什么模型在很小的物体上会骗人,在大物体上却很准?后来重复做了几次实验才发现,这不是模型“偏心”,而是视觉特征和语言先验的权重在变化。幻觉不是“看错了”,而是模型在做概率补全时,语言先验赢得了那次掷骰子。

这个问题在 2023 年得到了系统的验证。一项名为 POPE 的研究专门构建了一个幻觉测试集——给定一张图,然后提问“图片里有没有某个物体”,衡量模型说“有”的概率是否与事实相符。他们测试了当时七个主流的视觉语言模型,结论是:所有模型都会在相当比例的样本中“确认”图片里不存在的物体。这不是个别模型偶尔失灵,而是架构级的系统性问题。

为了抑制幻觉,研究者提出了不少办法。比如对比解码(VCD):把视觉特征和语言先验分开考虑,如果某个词只在语言先验里合理、在视觉证据里没有依据,就降低它的概率。还有一些方法:在训练时对物体描述进行显式的约束,或者在推理时加入“有没有?”的自我提问。这些方法能砍掉一部分幻觉,但同时也会让模型变得更“保守”——它可能不再说一个事实上存在但视觉特征较弱的小物体。这种矫枉过正,同样是问题。

人类为什么很少犯这种错?因为我们有一套对象验证回路。你看到一个东西,先形成感知,再匹配词汇;模型却相反,它先预测词汇,再去“脑补”一个对应的画面。它生成的文本里没有一个机制回去扫描图片,逐项确认每个名词都有像素支撑。这是当前图像描述技术的一个根本缺陷。

我们来看看人和模型的差异:

维度 人类 图像描述模型
判断物体 先感知,后命名 先预测名词,再“脑补”画面
信息依据 真实场景的全景细节 压缩后的向量+语言统计
错误类型 偶尔误认,很少无中生有 容易把不存在的东西说得活灵活现
自我纠正 会回头再看,发现错误 没有回头检查的机制

到这里,你可能会问:有没有办法在实际使用时降低幻觉?说实话,现在还没有一劳永逸的方法,但有几个经验值得参考。

为什么模型描述得那么流畅,却会在细节上撒谎?

流畅和准确是两个维度。模型的训练目标是逐词预测,只要生成的句子语法通顺、上下文连贯,就算“好”。它从来没被训练成“如实报道”,所以它并不觉得自己在撒谎。对模型而言,“狗”和“门口”只是高概率搭配,不是事实陈述。

是不是模型越大,幻觉就越少?

不一定。POPE 的评测结果显示,部分大模型的幻觉率并不比小模型低。参数规模带来的是更强的记忆能力,但概率补全的机制没有变。如果训练数据里“人骑自行车”出现的次数远多于“人站在田野里”,更大的模型只会把这个偏置记得更牢。

我用的图像搜索、看图聊天等功能,会受影响吗?

会。只要是视觉语言模型直接生成的文字,都存在幻觉风险。尤其在中文、多指令对话这类场景,模型还可能因为人类偏好训练而变得更“爱补充”。如果你依赖它做决策,比如识别图片里的药品名称、商品型号,一定要加一道人工确认。

所以,下次你面对一个图像描述模型的输出,请记住:它是一个口若悬河的故事大王,也是一个不太靠谱的目击证人。大场景、常见物体、干净构图,它能说得很准;小物体、罕见物体、遮挡和计数密集的场景,你最好只把它的描述当参考,不要当事实。

幻觉问题的终极解法,可能不是继续给现有模型打补丁,而是改变“先预测语言、后依附视觉”的生成结构。在结构被改掉之前,我们只能带着怀疑去读它的每一句话。也别太放心上——它说自己说谎,是因为它从没学会“知道自己不知道”。

原创文章,作者:guanweilu,如若转载,请注明出处:https://guanweilu.cn/article/746.html

(0)
上一篇 29分钟前
下一篇 23分钟前

相关推荐