图像生成模型的评估:FID、CLIP Score、人类偏好——哪个更靠谱

你花了一个月训了一个图像生成模型。现在要写技术报告,证明它比别人的好。你放两张图,一张真实照片,一张模型生成,然后说“你们自己看”?这不行。你需要数字。FID 0.18,CLIP Score 0.32,人类偏好率78%。这三个数字一出,好像一切都有了定论。但我告诉你,这三个数字背后,每个都藏着一个陷阱。

AI technology illustration

FID:它测的不是“好不好看”,是“像不像真实分布”

我最早用FID时,以为它就是个“质量打分器”,数值越低,图像越好看。直到有次我的模型FID降了0.02,我兴奋地去看生成的图,结果发现一百张里有六十张是同一个人的脸。那一刻我才意识到,FID回答的根本不是“好不好看”,而是“生成图像和真实图像在Inception V3的特征空间里分布有多接近”。

具体来说,FID的做法是:用Inception V3把真实图像和生成图像都映射成高维特征,假设这两组特征各自服从高斯分布,然后计算这两个高斯分布之间的Fréchet距离。距离越小,说明两组特征越像。但问题就出在“假设”和“Inception V3”上。这个指标由Heusel等人在2017年提出,原文很严谨,但到了实际应用里,它被简化为一个数字,人们开始盲目追求低FID。

Inception V3是在ImageNet上训练的分类网络,它学到的是“这是猫”、“这是狗”这种粗粒度语义。它根本不关心花瓣边缘是否锐利、皮肤纹理是否自然。所以两个模型一个生成高清图,一个生成模糊图,只要物体的类别和大致布局差不多,FID可能差别不大。更麻烦的是,FID对模式坍塌非常迟钝。上面那个例子就是证明——生成分布集中在一小片区域时,协方差变小,反而可能跟真实分布的平均特征更接近,FID不升反降。这就像一个人所有答案都写同一个数,平均分可能还挺高,但你看一眼就知道是垃圾。

所以,FID低只说明“分布接近”,不代表“图像好”。在无文本生成的领域,它还能用;但如果你在调文生图模型,只盯FID,你会被带到沟里。

CLIP Score:测的是“像不像提示词”,但管不住细节

CLIP Score是随着CLIP模型流行起来的。它的思路完全不同:不看真实图像,而是看生成的图像跟你输入的文本提示词有多匹配。用CLIP分别编码图像和文本,算余弦相似度,分数越高,说明图像越“符合”提示词。CLIP模型本身是OpenAI在2021年发布的,核心是用4亿个图文对做对比学习,让图像和文本在同一个向量空间里对齐。

这个指标有一个明显的优势:它直接衡量了文生图模型最核心的能力——遵循指令。你输入“一只戴帽子的柯基”,如果生成出来一只没帽子的柯基,CLIP分数会很低。这比FID直观多了。

但CLIP的语义粒度太粗了。它的训练数据是互联网图文对,学到的匹配关系是概念层面的。“狗坐在椅子上”和“狗蹲在椅子上”,CLIP几乎分不出来。而且,CLIP对图像风格有强烈的偏好:它喜欢高饱和、高对比、边缘清晰的图像。这意味着,一张过度调色、看起来像塑料的图像,可能比一张自然真实的图像拿到更高的CLIP Score。有些生成模型为了刷分,专门往这个方向优化,结果生成的东西色彩艳丽但毫无质感。

更严重的是,CLIP对清晰度不敏感。你把生成图像缩放到一半分辨率,CLIP分数可能几乎不变,因为语义信息还在。但它已经模糊得没法看了。所以,CLIP Score高,只代表“语义对齐”,不代表“图像质量高”。

人类偏好:最接近真相,也最不科学

既然自动指标都有盲区,那直接问人总行了吧?这是最古老也最直接的评估方式:让一群人看两堆图,问他们哪个更好、更符合提示词。这是最接近最终用户体验的,因为你的模型最终是给人用的。

但它的缺点和优点一样突出。首先,贵。找20个人,每人看100组图,按最低时薪算也是一笔钱。其次,主观。审美偏好因人而异,有人喜欢写实,有人喜欢二次元。如果你找的20个人恰好都是二次元爱好者,你的模型评估结果就会偏向那个方向。第三,不可复现。你今天找人评的结果,明天换一批人可能就变了。

还有一个更隐蔽的问题:人类偏好并不等于图像质量。人往往被高饱和、高对比的图像吸引,即使它们偏离真实。这导致有些模型通过简单调色就能获得很高的人类偏好分,但这不代表它的生成能力更强。

所以,人类偏好是“金标准”,但它是把双刃剑——用它做最终决策可以,用它做日常迭代,成本太高。

所以到底该信谁?

我现在的看法是:没有哪个指标是绝对靠谱的,关键是看你评估的维度。下面这张表可以帮你快速判断:

指标 衡量维度 优点 致命缺陷 适合场景
FID 生成分布与真实分布的相似度 计算快,无需人工 对细节不敏感,对模式坍塌不敏感,受Inception V3特征空间限制 无文本条件的生成模型,衡量整体分布质量
CLIP Score 图像与文本的语义对齐 直接评估提示词遵循度,无需真实图像 语义粒度粗,对清晰度不敏感,有风格偏好 文生图模型的语义一致性评估
人类偏好 真实用户体验 最接近最终目标 昂贵、主观、不可复现 小规模验证、最终决策

你可以看到,它们三个根本不在同一个维度上。FID问的是“像不像真实世界”,CLIP问的是“像不像你说的”,人类偏好问的是“你喜不喜欢”。这三个问题,没有一个能完全代表其他两个。

我的建议是:如果你在做文生图模型,至少同时报告FID和CLIP Score——一个管分布,一个管语义。如果预算允许,再做一个小规模的人类偏好测试(比如20人,每组对比10次)。更重要的是,你要知道每个指标的盲区。我自己就栽过跟头:曾经为了把FID刷到0.1,我把模型调成了“猫脸生成器”——它生成的每张图都特别“标准”,但千篇一律,FID反而很漂亮。那次之后我明白了一个道理:指标是工具,不是信仰。你用它来发现问题,而不是用它来证明自己是对的。

几个常见问题,我顺手澄清一下

FID越低越好吗?

不一定。FID可能会被模式坍塌欺骗,也可能因为特征空间偏差而漏掉细节问题。在分布接近的同时,还要检查多样性。

CLIP Score高是不是就代表图像质量高?

不是。CLIP Score只衡量语义对齐,不衡量清晰度、纹理、美感。一张模糊但颜色鲜艳的图像,CLIP分数可能比一张高清自然图像更高。

人类偏好评估是不是最公平的?

也不尽然。人群选择有偏差,而且评估指令会影响结果。但它是目前最接近“最终用途”的指标,适合做最终验证。

总结一下:FID、CLIP Score、人类偏好,各有各的盲区。如果你非让我选一个最靠谱的,我会选人类偏好——因为它衡量的是你真正关心的东西。但如果你需要在训练过程中快速迭代,自动指标依然不可或缺。关键不是找到“完美指标”,而是理解每个指标在骗你什么。

原创文章,作者:guanweilu,如若转载,请注明出处:https://guanweilu.cn/article/258.html

(0)
上一篇 2026年8月22日
下一篇 2026年8月22日

相关推荐