我最早是被 Gemini 的宣传片震到的那批人。视频里的它跟人实时互动,你画我猜,认鸭子认恐龙,反应快得像个人。看完那个片子,我一度认真思考要不要把 ChatGPT 的订阅停掉。后来 Google 官方出来澄清:那个视频是剪辑的——静态图片输入,延迟被删掉,失败的尝试被剪掉。再后来我自己上手,让它算一笔发票上的税额,三遍,三个不同的错法。

同一个模型,在MMMU 基准上拿到 59.4% 的分数,压过 GPT-4V;在真实用户手里却频繁翻车。这个落差不是 Gemini 独有的,但它是目前最显眼的。这篇文章我想聊聊:评测分数和真实体验之间的鸿沟,到底是怎么挖出来的。
先看评测是怎么跑的
MMMU 是过去两年最受重视的多模态基准之一,11.5K 道选择题,覆盖六大学科。模型拿到一张图片和一道题,在四个选项里选一个。整个过程像一次闭卷考试:
- 题目来自公开教材和课程材料
- 每题配一张图片和四个选项
- 模型输出一个字母,对错一锤定音
- 最后计算整体准确率,用于排名
听起来很公平?问题恰恰藏在“公平”的外观里。
一道 MMMU 风格的题(示意)
图像:显微镜下的细胞分裂照片
题干:图中的细胞正处于哪个分裂阶段?
A. 前期 B. 中期 C. 后期 D. 末期
模型只需要输出一个字母。
你发现了吗:图片只是辅助材料,真正的解题线索大量存在于题干文本里。模型只要见过足够多类似题目,不真正理解图像内容,也能猜对不少。
多选题的陷阱:模型可以不看图
这是多模态评测的公开秘密:在很多主流基准上,只把文字问题丢给一个纯文本模型,它的得分远高于随机瞎猜的 25%;在部分子集上甚至能接近一半。图片是加分项,不是必要条件。模型非常擅长利用这种文字捷径——训练时它读过海量百科和教材,测试时靠文本匹配就能答对很多题。评测分数里的“多模态理解”,有相当一部分其实是“文本模式匹配”。
真实用户可不会配合。你发一张画质很差的手机截图给它,问某段文字在哪、某张发票金额是多少——这些图片从未出现在任何教材里,文字捷径瞬间失效。分数与体验的落差,就在这一刻被撕开。
这个问题我最早是在翻多模态幻觉研究时意识到的。当时看到一个例子:模型一本正经地描述图里根本不存在的物体,被追问时还更笃定了。后来这类故障被做成基准,比如HallusionBench,专门暴露视觉-语言模型“看见了自己没看见的东西”。
最难的排查:模型可能背过考题
评测数据来自公开教材和维基百科,而大模型的训练语料几乎吞下了整个公开互联网。两道菜,用的是同一份食材。
OpenAI 在GPT-4V 系统卡里专门讨论过这个问题:视觉-语言任务的评测集污染,比纯文本评测更难排查。你很难精确判断一张图片或图文组合是否已在训练语料里出现——哪怕没有主观作弊,你也无法确认模型有没有“背过”答案。
这不是在指控 Google 故意灌水,而是在说:评测体系本身没有能力区分“记住”和“理解”。只要这两者无法区分,“分数虚高”就是所有模型共享的系统性误差,只是程度不同。
平均分的陷阱:它不告诉你失败模式
MMMU 四选一,随机正确率 25%,所以模型间得分差距往往只有几个百分点。59.4% 和 56.8% 看起来差了一个身位,但统计上可能远没有新闻标题那么激动人心。
更麻烦的是,平均分把失败模式抹平了。我拿两个模型做过一个非正式的小对比:让它们读杂乱的桌面照片,描述物体位置关系。模型 A 的错误高度集中在遮挡场景;模型 B 均匀分布在所有场景。两者总分几乎一样,真实体验却完全不同——A 是“稍微复杂就翻车”,B 是“时好时坏不可预测”。你对模型的信任感,不是一个数字能传达的。
考试和真实世界,终究是两个世界
多模态基准考的是闭卷选择题,真实用户交付的是开放世界任务。差异可以用一句话概括:
选择题的仁慈在于,无论模型多困惑,它总能选出一个答案。而真实世界的严肃在于,一个合格的助手应该在看不懂时说“我看不清”,而不是硬着头皮编一个听起来合理的答案。
评测分数不会惩罚“嘴硬”,但用户会。
Gemini 为什么格外刺眼:宣传把预期抬到了天花板
如果你把评测分数理解为能力上限,那 Gemini 的发布宣传几乎没有给真实体验留退路。Google 官方博客将多模态表现作为核心卖点,再配上一段被剪辑过的演示视频,所有人的期望都被拉到了不现实的高度。
我不是在说 Google 造假——评测分数是实打实的,演示视频也写了免责声明。但免责声明和热搜之间,往往是后者赢了。当真实体验与期望出现落差,用户不会觉得自己读错了评测方法,只会觉得:模型不行。
那以后怎么测才算靠谱
过去两年,业界已经有了一些探索,方向大致有三个:
| 方向 | 思路 | 代表 |
|---|---|---|
| 真实任务仿真 | 用真实用户需求而非考试题构建评测 | SEED-Bench |
| 对抗性评测 | 故意构造刁钻样例,逼模型暴露边界 | HallusionBench |
| 人类盲测 | 让真人直接对比模型输出,按偏好打分 | Chatbot Arena 思路 |
这些方向有一个共同点:不再执着于“模型拿多少分”,转而关注“模型会在哪里失效”。我觉得这才是评测的本来职责。
所以,以后怎么读刷榜新闻
下次看到“新模型登顶”的标题,建议先问三个问题:
- 这份考题,模型可能提前背过吗?——看题目来源是否公开。
- 这个任务形式,和我真正要用的场景一致吗?——多选考试不等于开放对话。
- 分数差距,超出随机噪声了吗?——四选一题型里,几个百分点的差距都很敏感。
Gemini 这场讨论的真正价值,不是让我们质疑某一家公司,而是让我们意识到:排行榜提供的是比较,不是真实。在模型真正贴近真实世界之前,我们最好先学会——别把分数当成能力。
原创文章,作者:guanweilu,如若转载,请注明出处:https://guanweilu.cn/article/369.html