我一直觉得,AI 模型的排行榜是个玄学。

今天这个模型拿了第一,明天那个模型又登顶了。评论区吵成一团:有人说“分数高不代表好用”,有人说“你懂什么,这叫客观评估”。我一度很困惑——到底谁说的对?
直到我搞明白 Chatbot Arena 的评分机制,才意识到:也许那个最“不科学”的排行榜,才是对普通用户最有参考价值的。
为什么?因为它的分数,不是用算法算出来的,而是用你的手,一次一次点出来的。
什么是 Elo 评分?
Elo 评分系统诞生于国际象棋界,用来衡量棋手的真实水平。核心思想很简单:
赢家从输家那里拿分,分数不是固定的,而是根据双方实力差距动态调整——如果你赢了实力远高于你的对手,你会得到很多分;如果你输给了本就应该赢的对手,你会丢很多分。
具体步骤是这样的:
- 每个棋手都有一个初始分数(通常 1500 分)。
- 比赛前,根据双方分差计算期望胜率。公式是:期望胜率 = 1 / (1 + 10^((对方分数-己方分数)/400))。
- 比赛后,根据实际结果更新分数:新分数 = 旧分数 + K × (实际结果 – 期望胜率)。K 是一个常数,控制分数波动的幅度。
注意,这里的关键是“期望胜率”。分差越大,期望胜率越悬殊。如果你以 90% 的期望胜率赢了对手,你只加一点点分;但如果你输了,你会被扣掉一大笔分。这就是 Elo 系统的自我校正能力。
Chatbot Arena 是怎么把 Elo 用起来的?
LMSYS(一个学术研究组织)在 2023 年推出了 Chatbot Arena。它的玩法是:
- 你随机匹配两个匿名模型,比如 A 和 B。
- 你和它们各聊一轮,然后投票:哪个回答更好?
- 所有投票汇总,用 Elo 算法更新两个模型的分数。
匿名很关键——你不知道对面是 GPT-4 还是某个开源小模型,只能凭回答质量判断,这样能避免品牌偏见。
一个模型在 Arena 里“赢了”另一个,不是因为它准确率高,而是因为它让一个真实的人类觉得更满意。
这跟传统自动评测的差别,几乎是本质性的。
自动评测:客观,但刻板
我最早是迷信自动评测的。像 MMLU 这种测试,模型要回答几千道选择题,涵盖数学、历史、法律,最后给个准确率。多客观啊,连答案都是标准化的。
但用久了你会发现一个问题:MMLU 考的是知识,不是“会聊天”。
- 自动评测有标准答案,而真实对话根本没有“标准答案”——你说“请给我写首诗”,什么算好?
- 自动评测只能测知识类任务,测不出语气、幽默感、创造力、同理心。
- 自动评测可以用“技巧”刷分。比如有人发现,在训练数据里加入测试集类似的题目,分数就能飙升。这叫“数据污染”。
- 更重要的是,自动评测的分数是“人为设计的标准”,但真正评判一个模型好不好用,应该看它是否满足人类的主观需求。
我把自动评测和人类偏好投票放在一起对比一下:
| 维度 | 自动评测(如 MMLU) | 人类偏好投票(Chatbot Arena) |
|---|---|---|
| 测什么 | 知识准确率 | 综合对话质量 |
| 答案 | 有标准答案 | 没有标准答案 |
| 谁来评判 | 脚本比对 | 真人投票 |
| 能刷分吗 | 能,数据污染就行 | 很难,需要真人真的觉得好 |
| 成本 | 低,几小时跑完 | 高,需要大量用户投票 |
| 代表意义 | “知识量” | “用户体验” |
这里有个很容易误解的地方:我并不是说自动评测没用。而是说,自动评测测的是模型“会不会”,人类偏好测的是模型“好不好用”。这两个维度有很大差异。
我踩过的坑:我以为“客观”就等于“正确”
有一阵子,我很迷 MMLU 的分数。每次新模型出来,都去看它的 MMLU 涨了多少分。直到我实际去用那些高分模型,才发现有些模型在真实对话里表现糟糕:废话连篇、答非所问、稍微绕一点就崩。
后来我终于想通了:MMLU 是“考试”,而用户要的是“陪伴”。考试有标准答案,但用户的问题千奇百怪,没有唯一正确回答。
这时候我才理解 Chatbot Arena 的价值——它让几百万真实用户,用最朴素的“谁的回答我更满意”来做裁判。你可能会问,人人的主观感受不一样,投票结果靠谱吗?
答案是:正因为每个人标准不一样,投票才更接近真实世界。你喜欢的风格未必是我喜欢的,但一个模型如果能赢得大多数人的偏好,至少说明它在多数场景下是更讨人喜欢的。
Elo 的陷阱:它也不是完美无缺的
不过,Arena 的 Elo 评分也有一些被反复讨论的缺陷:
- 长度偏见:研究论文发现,模型回答越长,越容易被投票者认为更好。这导致许多模型在 Arena 上“注水”,故意把回答写得很长。
- 位置偏见:同一个回答放在左边和右边,获得的胜率可能不同。有些模型会受影响。
- 闭环问题:Arena 的排名是相对的,如果最强模型不参与,次强模型就会变成第一。所以它不能给出绝对能力值。
- 投票者分布:投票者多是普通用户,更偏好“友好、健谈”的风格,而不是“严谨、精确”的风格。所以专业领域强的模型可能排名偏低。
但这些问题不影响它的核心价值:它提供的是一个“用户满意度”的标尺,而不是“知识储备”的标尺。
那排行榜到底该怎么看?
- 如果你是想选一个模型做正经事(比如写代码、分析数据),去看专业自动评测(比如 HumanEval)会更准确。
- 如果你是想选一个模型聊天、写文案、做头脑风暴,Arena 的排名更贴近你的真实体验。
- 两者结合起来看,才能看到一个模型的完整画像。
Chatbot Arena 和 Elo 评分不是银弹,但它是第一个把“人类偏好”做成大规模、可比较、持续更新的评测体系。它让模型之间的竞争不再局限于“知识问答”,而是回到了“用户体验”这个本质上。
现在,每当我看到一个新的排行榜,我都会问一句:这个榜是谁评的?如果是算法,我会心存怀疑;如果是真人,我会认真看。
毕竟,AI 最终是给人用的,那最终裁判,也应该是人。
原创文章,作者:guanweilu,如若转载,请注明出处:https://guanweilu.cn/article/248.html