把一张画满箭头和方框的架构图扔给Claude 3 Opus,几秒钟后它说:"这个支付流程里,你的回调地址没有处理超时重试,数据库写入和消息队列之间还缺事务保护。"我盯着那张自己画的草图——字迹潦草到同事都看不懂,它却连箭头旁边的小字都读出来了。

这件事让我意识到一个尴尬的事实:Claude 3发布时,大家的注意力全在它作文写得多好、推理多强上,视觉能力几乎是顺带一提。但几个月用下来,我越来越觉得,Claude 3的视觉能力可能才是它被低估最严重的地方。
先看数据。Anthropic官方公告中,Claude 3 Opus在四个常见视觉基准上的成绩是这样的:
| 基准测试 | Claude 3 Opus | GPT-4V | Gemini Ultra |
|---|---|---|---|
| MMMU(大学多学科考试) | 60.8% | 56.8% | 59.4% |
| MathVista(数学视觉推理) | 50.5% | 43.4% | 53.0% |
| AI2D(科学图表理解) | 77.6% | 71.9% | 79.6% |
| ChartQA(图表问答) | 80.9% | 78.5% | 88.4% |
注意:Claude 3和GPT-4V的数据来自Anthropic的测试,Gemini Ultra的数据来自Google技术报告,测试条件不完全一致,直接横向对比有失公允。但至少能看出,Claude 3 Opus的视觉能力不是"能看"的水平,而是"能打"的水平。Gemini Ultra在纯图表任务上确实更强,但问题在于——绝大多数人根本用不到Gemini Ultra。
为什么一个以文本能力出名的模型,视觉也能这么强?这要从多模态架构说起。Claude 3不是先把图像转成文字再让语言模型处理——那是早期模型的做法。从Anthropic公开的信息和行业常见做法推断,Claude 3应该有一个视觉编码器,把图像切成小块,转换成与文本token等价的视觉token,然后和文本一起送进同一个Transformer。这意味着模型能在同一个注意力空间里同时计算"这张图表里的趋势"和"用户问的问题",而不是像拼接模型那样两边各算各的。
说人话就是:Claude 3看图表的时候,不是在"看图"或者"读文字",而是在把图像和问题当成一个整体来推理。这也是为什么它能看懂手写图表里的箭头和逻辑关系——那些信息藏在像素里,不是简单OCR能提取的。
但视觉能力是有代价的。图像token比文本token消耗多得多——一张普通截图可能相当于几千个token。这意味着同样的上下文窗口,传图能承载的信息量远小于文字。我在处理长PDF时,经常得先把页面拆成好几段,分批传给模型。这是目前所有多模态模型共通的限制,Claude 3也没能绕开。
我最早也低估了它。当时我在对比几个模型处理PDF截图的能力,心里预设Claude 3只会看文字。结果它不但读出了表格里的数字,还发现表格最后一行有一个汇总错误——那个错误是原文件里就有的。我反复确认了好几遍,最后只能承认:它不是在做简单的模式匹配。
这种体验和GPT-4V很不一样。如果你同时用过这两个模型,你会发现它们的风格差异很明显。GPT-4V在描述自然场景时更像人,会说"一辆红色的车停在树荫下";Claude 3则倾向于"图中包含以下可识别元素:车辆、树木、建筑物。车辆颜色为红色,位置在画面左侧"。前者更自然,后者更结构化。而在处理文档和图表时,结构化输出显然更好用。
那Gemini呢?Gemini系列从一开始就是原生多模态,理论上应该更占优。从Google发布的技术报告看,Gemini Ultra在ChartQA和AI2D上的分数确实比Claude 3 Opus还高。但真用起来,Gemini Ultra没有开放给普通用户,大多数人能接触到的Gemini Pro和Claude 3 Sonnet相比,视觉能力就有点差距了。
另外,Claude 3家族内部的视觉能力也有差异。Opus最强,Sonnet次之,Haiku最弱但速度最快。如果你只是偶尔分析图表,Sonnet的性价比很高;但如果你是重度用户,需要处理复杂图表,Opus多出来的那点准确率值这个差价。
为什么Claude 3的视觉能力会被低估?我觉得有两个原因。第一,Anthropic在发布时把宣传重点放在文本长上下文和推理上,视觉被放在一个不起眼的位置。第二,大多数人测试视觉模型时,只会丢几张猫狗图片让它描述,而Claude 3强的是图表、文档、截图这类信息密集的图像。你拿它认猫,它可能还不如GPT-4V;你拿它分析年报,它能给你写出三条风险点。
根据我的使用经验,Claude 3的视觉能力在以下场景最值得发挥:
- 图表分析:K线、柱状图、折线图,它能读出趋势并解释异常点。
- 文档理解:PDF截图、扫描件、表格,它能提取结构化信息并做推理。
- 手写笔记识别:对潦草字迹的容忍度比预期高。
- 流程图/架构图理解:能看逻辑关系,而不只是识别形状。
- 错误排查:给它看代码截图或报错弹窗,它往往能直接指出问题。
Claude 3能识别图片里的文字吗?
能,但对高密度小字号文字可能漏读。建议放大后再传,或者用PDF上传而不是截图。
它能看懂手写体吗?
比想象中好,但太潦草或模糊会失败。我试过用手机拍的会议白板,它能认出大部分内容,但偶尔会把相似字母搞混。
和Gemini比谁更强?
静态图表和文档上,Claude 3更稳;Gemini在视频、音频等原生多模态场景有先天优势。但Gemini Ultra不开放,Gemini Pro的视觉能力在复杂图表上明显不如Claude 3 Sonnet。
回到标题的问题:Claude 3的视觉能力被低估了吗?我的答案是:不仅被低估,而且这种低估让很多人错过了它最实用的功能。它当然不是万能的——它对高分辨率图像的处理有token限制,复杂场景下可能"看"错,但它在一个非常关键的维度上做到了领先:把图像里的信息变成结构化的推理,而不是只给你一段描述。
如果你手上有一堆复杂的图表或文档截图,不妨试试把Claude 3当作一个"图像分析员"。它可能不会让你惊艳,但会让你越来越依赖。
原创文章,作者:guanweilu,如若转载,请注明出处:https://guanweilu.cn/article/270.html