多模态模型的军备竞赛:2024 年到 2025 年,主要模型的视觉能力进化时间线

我最早以为,多模态模型就是把语言模型外面套一层"看图识字"的外壳。直到2024年5月,我把一张密密麻麻的财务表格丢给刚发布的GPT-4o,它不但读出了所有数字,还主动指出了表格里一个异常值。那一刻我必须承认——视觉能力已经不是"附带功能",而是模型竞争力的主战场。

AI technology illustration

从2024到2025,各大厂的多模态模型几乎每隔几个月就刷新一次能力上限。这场军备竞赛到底比什么?我梳理了一条清晰的进化时间线,也顺便纠正自己几个曾经顽固的误解。

2024年初,多模态模型的通病是"看得见,但数不清"

早期的GPT-4V能告诉你图片里有一只猫,但问它"这张图里有几只猫",它经常答错。不是参数不够,而是视觉编码方式太粗糙——大模型看到的是被压缩成小块的低分辨率图像,细节早就丢了。那时的主流方法叫"视觉编码器+语言模型拼接",视觉部分像是外挂的眼镜,和大脑之间只通过一条窄带连接。

2024年2月,Google 发布 Gemini 1.5 Pro,第一个让人眼前一亮的变化:100万token的长上下文。很多人以为这只是"能读更长的文档",但它的视觉意义被严重低估——模型终于可以一次性接收一张高分辨率大图,或者一整段视频的每一帧,而不用先压缩到模糊。

Claude 3的进步让我意识到,视觉的瓶颈不是像素,而是推理

2024年3月,Anthropic 发布 Claude 3 系列,其中 Opus 在 MMMU 这类视觉推理基准上超过了 GPT-4V。MMMU 是大学水平的图表题、物理题、地图题,光把图"看清"远远不够,你得真的理解图像里的逻辑关系。Claude 3 的秘诀不是更大的模型,而是更高质量的训练数据——尤其是"视觉指令微调"数据,让模型学会对着图表展开一步一步的推理。

这事让我很意外。我原来以为模型能力主要取决于参数量,后来发现数据清洗和任务设计往往更关键。Claude 3 给我上了一课。

GPT-4o:把"看"的速度拉进实时对话

2024年5月,OpenAI 发布 GPT-4o,"o"代表 Omni,原生多模态。它最大的突破在交互速度:语音和视觉输入可以直接被同一个神经网络处理,延迟低到接近人类对话。视觉方面的实际提升是:OCR能力、表格理解、屏幕截图理解都跃升了一个档次。你拍一张菜单、一份手写笔记、一个报错截图,它能快速且有把握地读出来。

我甚至拿它当"眼睛"来看股票K线图,它能描述趋势并指出关键支撑位——虽然不一定对,但描述本身已经是以前模型做不到的。

开源模型的追赶:Qwen2-VL

2024年下半年,值得注意的不只是财大气粗的公司,还有开源社区。2024年9月,Alibaba 发布 Qwen2-VL,首次在视觉定位(告诉模型"红圈里是什么")和文档解析上接近商业模型。我实际用它跑过自己的电子发票解析,准确率惊人。这意味着视觉能力不再是秘密武器,而正在变成基础设施。

2025年:从"看懂"到"看着做事"

2025年3月,Gemini 2.5 Pro 发布,官方称其为"思考模型",它在视觉推理上的进步更加显著——能解复杂的数学图表,也能从几十秒的视频里找出因果关系。4月,GPT-4.1 加强了视觉定位和截图理解,特别针对"前端代码截图还原"这种任务。5月,Claude 4 发布,多模态推理继续升级。

但真正让我觉得进入新阶段的是:这些模型开始把视觉当作"行动"的输入。它们能看屏幕、找按钮、点连接、填表单——已经具备初级AI代理(Agent)的形态。

时间 模型 视觉能力的标志性变化
2024.02 Gemini 1.5 Pro 100万token长上下文,整段视频直接理解
2024.03 Claude 3 Opus 在MMMU等推理基准上超过GPT-4V
2024.05 GPT-4o 原生多模态,实时视觉对话
2024.09 Qwen2-VL 开源模型接近闭源,定位+OCR
2025.03 Gemini 2.5 Pro 思考模型,视觉推理再上一层
2025.04 GPT-4.1 细粒度视觉定位,代码截图理解
2025.05 Claude 4 多模态agent能力落地
什么是"原生多模态"?(点击展开)

拼接式多模态是先用视觉编码器把图像变成特征向量,再送给语言模型。好处是能复用现成的语言模型,缺点是视觉信息和语言信息在异质空间里对齐,容易丢失细节。原生多模态则让语言模型和视觉编码器共享同一个Transformer,在训练时一起更新,视觉和文本能在更底层融合。GPT-4o和Gemini都是这条路线的代表。

我最大的认知转变:视觉能力不是"看清",而是"组织"

我曾经以为,只要把图像分辨率提高、模型就能看得更清楚。但后来我明白,更高的像素只是给模型更多"原始线索",真正的挑战在于如何从这些线索里提取并组织出信息。Gemini 用长上下文保留细节,Claude 用高质量数据训练推理,GPT-4o 用统一架构减少信息损失——三条路线异曲同工:让视觉信息以更完整、更有结构的方式流入语言模型。

一个让我想通的技术细节是"视觉Token"的演变。早期模型把整张图压缩成固定数量的token(比如49个),每个token对应一块大区域,就像低像素马赛克。而新一代模型采用动态分辨率或像素交织,让重要区域获得更多token。Qwen2-VL的"动态分辨率"和Gemini的"像素交织"都是这个思路。这解释了为什么后来模型在"判断两个人谁站在左边"这类空间关系问题上进步神速。

但距离"人类视觉"还很远

即便到了2025年,多模态模型在透明物体、镜像、密集物体计数上依然会犯低级错误。你让它数一堆积木,它可能给出完全不同的三种答案。视频理解也还停留在"摘要"级别——模型能告诉你"这个人从冰箱里拿出了苹果",但无法真正理解苹果掉地上会碎这个物理常识。更严重的是幻觉:模型会基于图片里不存在的细节,编出一个合理的解释。在某些医学影像或自动驾驶场景里,这种幻觉是致命的。

此外,多模态模型的训练成本极高,每次升级都意味着海量GPU。这也让"军备竞赛"的参与者集中在少数公司手里,开源模型虽然追赶,但始终差一个代差。

我的判断

2024到2025年,多模态模型的进步不是"连点成线",而是"换了一条赛道"。2024年初,模型是"看图说话";2025年年中,模型是"看图推理、看图行动"。下一步的竞争焦点,大概率会落在"视觉世界模型"上——不是让模型识别一张图片,而是让它理解视频里的物理规律。那一天如果真的到来,不仅AI的视觉能力会翻篇,整个具身智能(机器人)领域也会跟着改写。

原创文章,作者:guanweilu,如若转载,请注明出处:https://guanweilu.cn/article/350.html

(0)
上一篇 2026年8月28日 下午5:44
下一篇 2026年8月28日 下午5:50

相关推荐