多模态大模型的图像描述能力:GPT-4V 和专用模型的描述有什么不同

同一张照片,两个模型,两句话。

AI technology illustration

我拿一张傍晚街头的照片同时喂给两个模型。专用图像描述模型(比如 Salesforce 的 BLIP-2)稳定输出:"A man rides a bicycle on the street."——语法没错,信息也没错,但你转头就忘。

GPT-4V 的版本长这样:"傍晚的街道上,穿蓝色外套的骑手刚转过街角,车筐里露出超市纸袋,身后的路灯刚刚亮起。"——有穿着、有动作、有氛围,甚至有一点叙事感。

哪个更好?没有标准答案。但为什么两类模型的描述风格差这么多,里面藏着一个值得拆开的机制问题:"图像描述"这四个字,对它们来说根本不是同一个任务

专用模型的病根:它学的是"最安全的句子"

要理解专用描述模型,先看它的训练数据长什么样。COCO 数据集每张图配了 5 句人工写的描述。训练目标是把每句描述下一个词的概率同时最大化——也就是最大似然估计。

这个目标有一个隐蔽的副作用:对模型来说,最划算的做法不是描述这张图独有的细节,而是输出一个在所有图片上都"平均正确"的句子。一句参考描述里,"穿蓝外套"只在 5 句里出现 1 次,在期望损失里只有 1/5 的权重;"a person"出现 5 次,权重拉满。于是模型学到的策略很简单:越是安全、常见的词,越要给出高概率。

这就是为什么你用 BLIP-2 描述十张不同的照片,可能得到九句以 "A person…" 开头的句子。不是它傻,是损失函数逼它当"平均人"

这个问题在 2016 年的 SCST 论文里就被点过名——交叉熵训练让描述模型倾向于输出泛化的句子,作者干脆把 CIDEr 分数直接当强化学习的奖励来优化。但注意:用 CIDEr 优化,只是换了一种方式继续讨好"平均人"。CIDEr 本身就是拿你的输出跟人工参考描述做 n-gram 重合打分。

这是第一层差异:专用模型的"好描述",被定义成了"跟参考描述长得像"。BLIP-2 论文摘要的原话是:"BLIP-2 bootstraps vision-language pre-training from frozen pretrained image encoders and frozen large language models."

GPT-4V 的差异不在规模,在训练目标

很多人默认 GPT-4V 强是因为"更大"。规模当然重要,但更本质的是训练目标变了。

GPT-4V 不是"看图写话"系统,而是一个能看图的对话系统。它的训练目标,是在开放的多轮对话里输出让人类满意的回答——指令微调加对齐人类偏好。OpenAI 的系统卡没有公开架构细节,但明确记录了它经过大量人类反馈和红队测试来对齐行为。

这个差异直接改变了"描述"的定义:

  • 专用模型没有用户,没有上下文。它生成一句固定长度的文字,你没法对它说"太长了,短一点"。
  • GPT-4V 可以连续追问:"只描述构图"、"换成一联诗"、"把焦点放在车筐上"。它每次都在为眼前这个具体的用户生成内容。

我最早以为这只是"灵活 vs 死板"的体验差异,后来才意识到它是优化目标的数学差异:专用模型的损失函数里没有"用户"这个变量;GPT-4V 的整个训练流程里,人类偏好就是奖励函数。所以它倾向输出具体、自然、有信息量的句子——因为人类评分员就喜欢这样的回答。

一张表说清两条路线差在哪

维度 GPT-4V 专用描述模型(BLIP-2 / InstructBLIP)
优化目标 指令跟随 + 人类偏好对齐 最大化参考描述的似然
架构 未公开,统一多模态模型 ViT 编码器 + Q-Former + 冻结 LLM
交互 多轮对话,可追问、可修正 单次生成,无状态
控制粒度 可指定风格、长度、语言 固定输出,只能"写一句描述"
典型失败 数错物体、空间关系混乱、细节幻觉 泛泛而谈、忽略独有细节、无推理
基准表现 CIDEr 上未必占优 长期霸榜,恰好因为"平均描述"命中指标

CIDEr 是怎么把"平均描述"捧上冠军的

NoCaps 是图像描述最常用的零样本基准,主指标依旧是 CIDEr。它的算法本质是:把你生成的句子和每个人工参考描述做 n-gram 重合统计,重合越多分越高。CIDEr 论文发表于 2014 年,当时确实合理——它的初衷是捕捉人工标注之间的一致性。

但这个指标天然奖励平均人。一张图 5 句参考,"骑手穿蓝外套"只出现在 1 句里,只有 1/5 的投票权重;"一个人在街上骑车"出现在 4 句里,权重 4/5。要拿高分,就得输出最没信息量但最常出现的句子。于是榜单前列的专用模型,生成的句子常常像同一个模板换了主语。

这就出现了一个反直觉现象:GPT-4V 在人类眼里描述得更丰富,在 CIDEr 榜上却可能干不过一个小得多的专用模型。它的描述加入了参考句里没有的推断和细节——n-gram 不重合,分数被罚,但描述本身并没有错。

这个坑我踩过。早期选模型时我只看基准分,选了 NoCaps 分最高的模型跑业务,结果产出的描述千篇一律,用户反馈"每张图都像同一张图"。后来才想通:基准分衡量的是"和平均人有多像",不是描述质量

选型判断:什么任务该用谁,什么任务谁都不该用

机制差异落到工程选型,结论很干净:

  • 跑大规模商品图描述、生成 schema 化的 alt text、把"图到文"当成流水线的一环——专用模型仍是对的答案。快、便宜、稳定、可复现,一块 T4 就能跑。GPT-4V 的成本和延迟在这里不划算。
  • 要的是"理解"而不是"标注"——比如根据图片回答追问、生成有语境的配图说明、辅助内容审核,GPT-4V 这类通用模型才值得上。它的优势不在单次输出的准确率,在"能对话"本身。
  • 需要精确数数和精细空间关系的场景("图里有几个红色按钮")——谁都不该用。GPT-4V 会一本正经地编一个数字,专用模型也好不到哪去。对 GPT-4V 的早期评估发现它在细粒度计数和感知上有明显短板。这类任务交给目标检测模型出结构,再用 LLM 做文字组织。
顺带说一句:Q-Former 是什么?

BLIP-2 的核心是 Q-Former:一个轻量 Transformer,把图像编码器输出的特征压缩成固定的 32 个 query token,再作为文本前缀喂给冻结的 LLM。InstructBLIP 在它基础上加指令微调,改善了按指令描述的能力,但单轮、无状态的底子没变。这个窄瓶颈设计省了训练成本,代价是信息经过压缩必然有损——它在描述独有细节上不如通用大模型,是结构性的。

三个常见误解

GPT-4V 在所有图像任务上都碾压专用模型?

不是。在以 CIDEr 为准的基准上,专用模型长期有竞争力;在需要精确感知的任务上,GPT-4V 不可靠。碾压只存在于"开放式理解"这一类任务里。

为什么专用模型总爱说 "A person" 而不是更具体的词?

因为 5 句参考描述里 "a person" 出现的次数压倒性地多于任何具体指代。最大似然训练下,这是数学上的最优策略。想让它更具体,得换训练目标(比如 RLHF),而不是调参。

未来专用图像描述模型会消失吗?

不会消失,但会转型。可以确定的是,"描述"这个任务的定义正在从"输出一句和参考很像的话"变成"在对话中满足用户的表达需求"——后者是 GPT-4V 这类模型的赛道,专用模型在这里没有位置。

说到底,两类模型的差距不在"谁更会看图",而在它们把描述当成什么任务。专用模型在做标注——输出一句和人类参考高度重合的文字;GPT-4V 在做对话——在一个具体语境里满足一个具体的人。前者被指标锁死,后者被偏好驱动。

这个分野还在扩大,而且不会被"把专用模型做大"解决,只会被评价体系的重构解决。当越来越多的团队用任务完成度而不是 CIDEr 来评估描述能力时,"平均描述"这个最优解就会失效。到那天,图像描述作为独立研究课题就只剩一个子问题:在低算力、低延迟、可控的前提下,尽量逼近通用模型的表现。我的判断是:这个转向已经在发生,而且比大多数人以为的更快

原创文章,作者:guanweilu,如若转载,请注明出处:https://guanweilu.cn/article/617.html

(0)
上一篇 1天前
下一篇 1天前

相关推荐