图像描述的评价指标:CIDEr、SPICE、METEOR——哪个和人类判断最一致

我最早以为,评价一个图像描述模型,跟评价一个翻译模型差不多——拿它生成的句子和参考答案比一比,算个重合度就完事了。这个错觉让我在第一次训练描述模型时栽了个跟头:CIDEr 分数一路从 0.8 涨到 1.1,模型输出的描述却越来越像一个复读机——a man is standing on the streeta dog is sitting on the grass。分数在涨,质量在跌。

AI technology illustration

后来我才想明白:问题不在模型,在我。我用了一个我根本不理解的指标,还把它当成了正确答案。这篇文章想跟你聊清楚:CIDEr、SPICE、METEOR 到底各自在算什么?哪个最接近人类的判断?先说结论——没有一个能永远赢。

图像描述没有标准答案,所以只能比"像不像"

分类任务有标准答案:猫就是猫,狗就是狗。图像描述没有。同一张照片,一个人说 a dog running in the grass,另一个人说 the dog is playing with a ball,都是对的,甚至没法排序。

所以所有自动指标都采用同一个策略:拿模型生成的描述,跟一组人类写的参考描述比较,越像越好。于是"评价质量"就变成了"计算相似度"——而相似度怎么算,决定了指标会奖励什么、忽视什么。

METEOR:从翻译界借来的老兵,看单词不看语序

METEOR 是三者中最老的,出身是机器翻译(Banerjee & Lavie 2005),后来被图像描述领域直接借用。它的匹配单位是单个单词,但做了三件 BLEU 做不到的事:

  • 同义词匹配:通过 WordNet,carautomobile 算同一个意思;
  • 词干匹配:runningrun 算同一个词;
  • 碎片惩罚:匹配片段越零散,扣分越多,能连成整块的匹配才算是好匹配。

最终分数是一个更偏向召回率的加权调和平均再乘上碎片惩罚。这个设计在当年很先进——它第一次让指标能认出近义改写。所以 a dog running in the grassa dog is running on the lawn,METEOR 给的相似度很高。

但它有一个致命盲区:只看单词,不看语序dog bites manman bites dog,METEOR 会给出满分——三个单词全部匹配。对翻译或许可以容忍;对图像描述,这就是灾难:"猫在沙发上面"和"沙发在猫上面"是两个完全不同的画面。

CIDEr:把"人云亦云"变成数学

CIDEr 的名字已经暴露了野心:Consensus-based Image Description Evaluation。论文(Vedantam 等人,CVPR 2015)的核心洞察很朴素:与其问"这句话对不对",不如问"这句话是不是大多数人对这张图会说的话"。人类在评价描述时其实也是这么干的——跟大众共识越接近的描述,越容易被判为好。

把"共识"变成公式,CIDEr 做了两步:

  1. 给每个 n-gram(1 到 4 元)算 TF-IDF 权重。TF 是它在本句出现的次数;IDF 统计整个数据集里有多少条参考描述包含它——满大街的 aof 权重趋近零,稀有的 surfing 权重被拉得极高。
  2. 把候选描述和每条参考描述都表示成 n-gram 权重向量,算余弦相似度,1 元到 4 元的结果取平均。

这一步很聪明:它自动学会了分辨谁才是真正有信息量的词a dog is runninga dog is surfing 都占着 a dog is,但参考描述里大概率会写 surfing——一个稀有词,权重极高,直接拉开差距;而那些每句都出现的废话词,对分数几乎没有贡献。

后来作者又加了两个修正,成为我们今天常用的 CIDEr-D:词频截断到 1(防止重复刷分),外加长度惩罚(太短扣分)。论文里正是这个版本与人类判断相关性最高。注意,IDF 是在特定数据集的参考描述上统计的——所以 CIDEr 分数跨数据集不可比,这是它的第一个暗门。

什么是 PASCAL-50S 的"共识分"?

Vedantam 等人在 PASCAL 句子上重新收集数据,让每张图拥有 50 条人工描述;再让标注者成对判断两条描述的意思有多接近。某条描述与其余 49 条的平均相似度,就是它的共识分。假设是:如果大多数人都这样描述一张图,那这个描述就是"对"的。

SPICE:把句子拆成图,专抓色盲和幻觉

CIDEr 和 METEOR 都在"字的表面"上做文章。SPICE 换了一条路:先把句子解析成场景图,再比较图的结构

Anderson 等人(ECCV 2016)用解析器把 a white dog is chasing a black cat 拆成三组语义元组:物体 {dog, cat}、属性 {white→dog, black→cat}、关系 {chase→(dog, cat)}。参考描述也做同样拆分,然后在这三组元组上分别算精确率、召回率和 F1,同样带 WordNet 同义词匹配。

感受一个例子:a white dog and a black cata black dog and a white cat。两个句子的单词集合一模一样。METEOR 会给近乎完美的相似度;CIDEr 只扣一点分,察觉不到有多离谱。SPICE 呢?属性元组里 white 对应的对象从 dog 变成了 cat——它直接看出颜色和物体配错了,属性子分数大跌。

再看物体幻觉:参考是 a man sitting on a bench,模型生成 a man sitting on a horse。两者共享大量 n-gram,CIDEr 照样给不低的分;但 SPICE 的物体元组里冒出一个参考里根本不存在的 horse,精确率被打穿。这正是后来物体幻觉检测研究普遍把 SPICE 当工具用的原因。

三个回合的证据:谁跟人类判断最一致?

现在进入最核心的问题。我们把证据分成三个回合。

CIDEr 对战共识分:登基时刻

Vedantam 等人在 PASCAL-50S 上让 50 条人工描述两两比较,得到共识分当作伪真值。结果CIDEr-D 与人类共识的秩相关显著高于 METEOR,BLEU 更是被甩开一大截。这基本上是 CIDEr 登基的时刻——此后几乎所有图像描述论文都在报 CIDEr。

SPICE 对战语义细节:谁抓得住"颜色错了"

Anderson 等人用人类评价在 COCO 上做了类似分析:SPICE 的整体相关性与 CIDEr 打平,但在属性(颜色、大小)和关系(位置、动作)两个维度上显著优于 CIDEr。如果你关心"颜色说没说对、动作说没说对",人类站在 SPICE 这边。

一盆冷水:换个数据集,结论就翻了

Kilickaya 等人(EACL 2017)重新评测后发现:结论严重依赖数据集和人类标注协议。在 Flickr8K 和 Flickr30K 上各指标表现还算正常,METEOR 是其中相对稳健的一个;但在 COCO 上,几乎所有 n-gram 指标与人类判断的秩相关都低于 0.3——基本等于猜。

三个回合放在一起,你会得到一个不太舒服的结论:"哪个指标最像人类"本身没有一个稳定答案,它取决于数据、标注者和评分标准。

维度 METEOR CIDEr SPICE
匹配单位 单词(1-gram) n-gram(1–4) 语义元组(物体/属性/关系)
同义词处理 WordNet 同义 + 词干 WordNet 同义
语序敏感度 不敏感 部分敏感 通过关系元组敏感
最擅长 容忍近义改写 衡量整体共识度 抓属性错误和物体幻觉
最大盲区 dog bites man 属性/关系张冠李戴 解析器出错、句子不完整

更残酷的问题:指标一旦变成训练目标就会失效

比"哪个更像人类"更糟心的事实是:一旦你用指标去训练模型,指标就开始失真

最典型的例子是Self-Critical Sequence Training(Rennie 等人,CVPR 2017):把 CIDEr 当成强化学习的奖励直接优化。模型分数确实暴涨,但社区里反复观察到输出趋向平庸——满屏的 a person is … 式安全句子。

原因不难理解。CIDEr 奖励"与参考描述相似",而最相似的,恰恰是那些所有模型都能生成、最安全最泛化的句子。更麻烦的是,IDF 是从参考描述统计出来的:模型生成常见短语不赚分,生成罕见词又容易撞不上参考——最优策略就是说安全的话。你看,指标和人类在这里彻底分岔:人类喜欢具体、生动、有信息量的描述;CIDEr 喜欢安全、常见、平均的描述。

所以你会看到 COCO 榜单上永远是一排指标:BLEU、METEOR、ROUGE-L、CIDEr、SPICE,谁也不让谁单独说了算。

为什么不直接比较 BLEU?

BLEU 本质是加权 n-gram 精确率,不重视召回,也没有同义词处理。在图像描述任务里,BLEU 与人类判断的相关性通常是最差的一档,所以本文让位给它的三个亲戚。

CIDEr 分数可以跨数据集比较吗?

不能。IDF 是在特定训练集的参考描述上算的,换一个数据集,所有 n-gram 的权重全部重算。所以论文里的 CIDEr 只能跟同数据集的基线比,跨论文比分数没有意义。

哪个指标最不容易被刷分?

相对而言 SPICE 更难骗:它比对的是语义元组,想拿高分得在语义上真的对。但没有任何指标绝对安全。判断标准很简单:一旦某个指标被当作训练目标,它就开始失去评价价值

回到开头让我栽跟头的经历。回头看,CIDEr 没有骗我——它忠实地衡量了"模型输出与人类参考描述的 n-gram 共识度"。是我把"共识度"误当成了"质量"。

自动指标本质上是一种廉价的代理:它有偏见、会犯错、可以被利用。好的研究者不是去求一个完美指标,而是搞清楚每个指标在奖励什么、忽视什么,然后让它们互相制衡。图像描述的评价问题,说到底是在评价我们自己:我们够不够清楚,自己到底想要什么样的描述。

原创文章,作者:guanweilu,如若转载,请注明出处:https://guanweilu.cn/article/605.html

(0)
上一篇 1天前
下一篇 1天前

相关推荐