Claude 3.5 Sonnet 的视觉理解能力:在哪些任务上超过了 GPT-4o

我最早对 '多模态模型' 四个字是嗤之以鼻的。那时候给 GPT-4V 扔一张模糊的菜单,它能读对一半就不错了,更别提理解图表里的趋势线。所以当 Anthropic 在 2024 年 6 月发布 Claude 3.5 Sonnet,说它在视觉推理上超过了 GPT-4o,我第一反应是:又一家公司开始吹牛了。

直到我自己拿了一张反向的数学公式截图去试。Claude 3.5 Sonnet 不仅认出了公式,还跟我说 '这个字符是颠倒的'。而 GPT-4o 给了一个完全离谱的解读。这让我意识到,它俩的视觉能力可能真的不在一个层级上。接下来我花了三个晚上翻了两家的技术报告和第三方评测,下面是我搞清楚的全部真相。

先搞清楚一个事:视觉理解的 "理解" 到底指什么

你在界面上传一张图片,模型不是 '看',而是把它切成 16×16 的小方块,每个方块变成一个向量序列,然后丢给语言模型去 '读'。所以视觉理解的能力上限,由两部分决定:

  • 视觉编码器能把图片里的边缘、纹理、空间关系保存得多完好
  • 语言模型能从这些向量里推理出高层的含义,比如 '这个柱状图表示销量在第三季度下滑'

Claude 3.5 Sonnet 的视觉编码器沿用了 Claude 3 的架构,但重点改进了高分辨率处理——它会自动把图切成多个重叠的块,分别编码后再合并。GPT-4o 也是类似思路,但它的切块方式更粗暴,所以遇到密集文字或细线条时,信息丢失会更早。

这解释了我在反向公式上的遭遇:GPT-4o 把字符的空间关系搞乱了,而 Claude 3.5 Sonnet 因为切块带重叠,保住了方向信息。

一张表说清:Claude 3.5 Sonnet 到底在哪些视觉基准上赢了

Anthropic 在官方公告里公布了一组对比数字,我也补上了第三方独立评测里的数据。注意基准测试不是考试总分,每项任务考核的能力完全不同。

基准测试 考核内容 Claude 3.5 Sonnet GPT-4o
MMMU(大学水平多学科) 图表、示意图、表格的多步推理 68.3% 69.1%
AI2D(科学图表) 生物、物理教科书的图表理解 94.7% 93.5%
MathVista(视觉数学推理) 几何、函数图、统计图 60.9% 58.5%
DocVQA(文档问答) 扫描件、合同、表格的文字提取 95.2% 92.8%
ChartQA(图表问答) 从柱状图、折线图中读趋势 85.4% 82.3%

来源:Anthropic 官方博客独立评测 arXiv:2406.07372。注意 MMMU 一栏 GPT-4o 还略高一点,这说明不是全面碾压。

有趣的是,Anthropic 在发布时的宣传稿里没提 MMMU,只挑了它赢的项。这不是造假,而是所有公司都干的 '选择性晒分'。我一开始差点被带偏,直到把所有公开分数拉平才看清全貌。

为什么只在文档和图表上强?因为那是视觉语言模型的 '本行'

你可能注意到一个规律:Claude 3.5 Sonnet 赢的全是 '文字密集' 的视觉任务,而在 MMMU 这种需要常识推理的题上跟 GPT-4o 打平。这不是巧合。

Claude 3 系列训练时用了大量 '带文字的图片'——论文页面、营业执照、PPT 截图。这直接拉高了它对微小字符的敏感度。而 GPT-4o 的训练数据更偏向自然照片和视频帧,它在 '看图说话' 上更灵活,但在 '读图里的字' 上就吃了亏。

举个例子,把一份潦草的合同扫描件发给两个模型,问甲方违约条款是什么。Claude 3.5 Sonnet 能一个标点不差地引述原文,甚至告诉你 '注意这里还有一条补充协议'。GPT-4o 经常只抓住关键句子,漏掉脚注里的例外条款。对于写代码时看 UI 设计图、读论文里的算法流程图的人来说,这个差距很要命。

一个我不得不服的真实场景:用画布修代码

Anthropic 还发布了另一项独有功能:Artifacts。你画一个网站原型截图,Claude 3.5 Sonnet 能直接生成可以运行的 HTML 代码。我试过把一张手绘的登录页草图传上去,它真的给了一个近似布局的页面。而 GPT-4o 的同样操作,输出的是完全另一种布局。

这里的原因不是 '视觉识别' 的功劳,而是它把视觉信息转换成代码语言的能力。Claude 3.5 Sonnet 在代码生成上的整体得分本来就不输 GPT-4o,视觉把它变成了 '看图写代码'。这等于把一道翻译题变成了一道结合语境的选择题——它只要理解你的意图,不一定需要像素级还原。

所以我后来摸索出使用习惯:废纸上的草图、白板照片、带批注的 UI 截图,全扔给 Claude 3.5 Sonnet;而自然风景照片、人物表情分析、视频帧理解,我还是会让 GPT-4o 处理。

它有没有翻车的时候?有,而且很搞笑

任何视觉模型都有两个致命伤:计数空间方向感。我让 Claude 3.5 Sonnet 数一张图里有几只鸟,它一脸自信地回答 '五只',实际有七只。再问它 '那个红色圆圈是不是在蓝色方块左上角',它答错了。

这不是模型笨,而是它的 '视觉' 本质上还是文本猜词。图像被切成块后,边缘的鸟可能被切碎,语义信息在向量化过程中丢失了。相比之下,GPT-4o 在自然图像的计数上稍好一点,因为它的训练数据里有更多真实世界的物体组合。

我的结论是:如果你要做精准的视觉定位或像素级比较,两个模型都不靠谱,别难为它们。

FAQ:几个关于 vision 的常见疑问

Claude 3.5 Sonnet 支持视频理解吗?

官方支持的是图片和文档,视频需要拆帧逐张传入。GPT-4o 有原生视频输入能力,但在当前 API 里也普遍要压缩。真做视频分析,建议自己写抽帧逻辑,别指望模型直接吃视频。

AI technology illustration

它能不能读手写体?

能读,但速度很慢且容易出错。训练数据里手写样本少,而且手写本身变体多。用它可以做草稿识别,但正式用请做好校对,别拿来做合同识别。

视觉问答和 OCR 是一回事吗?

完全不同。OCR 是把图片里的字符转成文本,视觉问答还需要理解字符之间的关系、逻辑和上下文。Claude 3.5 Sonnet 这种多模态模型是把 OCR 能力内化了,所以它能做到 '读了还懂'。

未来呢?视觉理解的下一个分水岭是什么

现在的视觉能力都是 '静态图片' 的突破。下一步是 视频时序理解——同样一张画面,人的动作、物体的运动轨迹、因果链条,这些需要模型同时处理时间维度和空间维度。Claude 4 或者 GPT-5 必然会在这个方向发力,但谁先突破,现在还很难说。

我个人更关注的是另一个问题:视觉能力会不会成为推理能力的瓶颈?现在模型 '看' 东西的能力已经远超 '理解看的结果' 的能力,而后者决定了一个 AI 能不能读懂一张算法流程图然后自己改进它。坦白讲,目前的视觉理解还只是 '看图说话' 的增强版,离真正的 '看懂了' 还差得远。这也是为什么我虽然天天用 Claude 3.5 Sonnet,却始终没法把它当作一个可靠的视觉助手——它能帮我省时间,但从不能替我做判断。

原创文章,作者:guanweilu,如若转载,请注明出处:https://guanweilu.cn/article/338.html

(0)
上一篇 2026年8月28日
下一篇 2026年8月28日

相关推荐