你如果在 Hugging Face 上搜 NVLex,大概率会搜到一堆不相干的东西。原因很简单:NVLex 并不是模型的本名,而是中文社区对 NVIDIA 开源视觉语言模型 NVLM 的误写。NVLM,全称 NVIDIA Vision Language Model,论文标题叫 NVLM: Open Frontier-Class Multimodal LLMs。为了避免后面越读越乱,我统一把题目里的 NVLex 理解为 NVLM。

NVLM 和 DeepSeek-VL 放在一起看,其实是 2024 年多模态模型最有趣的对照实验。它们目的几乎一样:让语言模型不仅读文字,还能读图表、截图和照片。但在 "怎么把图片塞进语言模型" 这件事上,两边的答案几乎相反。
DeepSeek-VL:两只眼睛,一只看全局,一只看细节
DeepSeek-VL 来自中国 DeepSeek 团队,论文发表于 2024 年 3 月,开源了 1.3B 和 7B 两个尺寸。它的视觉前端没有用常见的单一 ViT,而是做了一个 Hybrid Vision Encoder(混合视觉编码器)。
一条分支是 SigLIP-L,把整张图缩到 384×384,理解画面里有什么;另一条分支是 ResNet-101,输入 1024×1024 的高清图,专门找回下采样时丢失的细节。两条分支的特征经过投影后拼在一起,再喂给 DeepSeek-LLM 底座。
我最早觉得这个设计有点笨:为什么不让一个编码器直接处理高清图?后来在 7B 模型上试识别身份证和发票才明白,单一编码器要么把整张图压得看不清小字,要么为了看清局部而丢失布局。两个极端分支互补,虽然增加了工程复杂度,但对真实世界数据非常有效。这种双分支设计的另一层好处是:模型可以在低分辨率分支上保底,不会因为某张图被切成 tile 后失去全局布局。例如一张从财报里截出来的表格,全局分支看表头结构,局部分支看每个单元格的字符,两者缺一不可。官方实现托管在 deepseek-ai/DeepSeek-VL。
训练上,DeepSeek-VL 走的是三阶段路线:先在图文对上做大规模预训练,再在交错的图文文档上继续训练,最后用 SFT 让模型学会回答问题。这套流程不追求一次性把所有能力塞进去,而是让模型一层层适应视觉输入。
NVLM:把一张图切成很多瓷砖
NVLM 发布于 2024 年 9 月,定位完全不同。它主打 72B 级别规模,并且在论文里同时比较了三种融合架构:decoder-only、cross-attention 和混合方案(论文内部叫 D / X / H)。
在高分辨率问题上,NVLM 没有另设局部编码器,而是采用 "tile-based dynamic high-resolution":把输入图片按长宽比切成若干 tile(瓷砖),每个 tile 和一张低清全局图一起进入同一个视觉编码器 InternViT-6B。图片越大,tile 越多,视觉 token 就越多。这种方法早期也被 CogVLM、Vary 等模型用过,但 NVLM 把它做成了动态的,并且配合了更彻底的数据策略。
这就像两台相机:DeepSeek 用一台广角加一台微距,NVLM 用一台相机拍九张照片。九张照片确实看得更细,但语言模型要读的 token 也变成了九倍,注意力计算量随之上涨。这种动态切图也带来一个工程问题:你无法提前知道一张图会产生多少个 token,所以推理时要注意位置编码的长度外推能力,以及 attention 的内存开销。NVLM 之所以把模型做到 72B,一部分原因就是要消化这些多余的视觉 token。
NVIDIA 在论文里还报告了一个反直觉的结果:多模态训练后,模型不仅在视觉任务上提升,纯文本任务平均还涨了 4.3 分。秘密在于数据混合——他们在视觉训练数据里刻意掺回了大量纯文本,防止语言能力发生灾难性遗忘。
更值得说的是,NVLM-D 的语言底座其实是 Qwen2-72B,视觉编码器是上海 AI Lab 的 InternViT-6B。换句话说,NVIDIA 把中国开源模型当成了基座,然后在这个基座上做多模态延伸。这也让 NVLex 和 DeepSeek-VL 的对决,更像中国开源能力内部的两条技术路线。
一张表看清两套技术路线
| 对比项 | NVLex(NVLM) | DeepSeek-VL |
|---|---|---|
| 发布时间 | 2024 年 9 月 | 2024 年 3 月 |
| 主推规模 | 72B 级 | 1.3B / 7B |
| 视觉编码 | InternViT-6B 加动态 tile | SigLIP-L 全局 + ResNet-101 局部 |
| 高分辨率策略 | 把图切成多个 tile,动态对齐 | 低清全局 + 高清局部两路并联 |
| 融合方式 | 视觉 token 拼进 LLM,decoder-only 路线 | 双分支视觉特征投影给 LLM |
| 语言能力保护 | 视觉数据混纯文本,文本分不降反升 | 三阶段训练,逐步引入视觉信号 |
这张表里的每一条都不是孤立的:DeepSeek 的双分支决定了它不需要太多视觉 token,因此 7B 也能跑;NVLM 的动态 tile 决定了它可以无限靠近像素级细节,但必须靠更大的模型和算力兜底。
选型建议:别只看跑分,先看你的图
如果任务以截图、文档、图表为主,且部署资源有限,DeepSeek-VL-7B 是更现实的起点。它 1024 分辨率和双分支结构对真实场景做了针对性优化,不需要八卡就能跑。
如果要处理 4K 屏幕截图、长文档扫描件,或者你有多卡 A100/H100,NVLM-D-72B 的动态 tile 更值得试。不过要提前想清楚:切 16 块 tile 产生的视觉 token,会让你的显存和延迟都不太友好。这是高分辨率能力的代价。
还有一个容易被忽略的指标:纯文本能力。如果你的系统还要做大量文本 chat,NVLM 的数据混合设计让它更安全;DeepSeek-VL 如果 SFT 数据没配好,语言能力可能会有折扣。
你可能还遇到的三个问题
NVLex 到底是什么? 它是 NVLM 的误写。NVIDIA 论文和官方仓库都用 NVLM,没有 NVLex。你可以在 GitHub 仓库里找到实现。
NVLM 开源到什么程度? 公开了 NVLM-D-72B 权重和推理代码,X/H 架构主要用于对比验证,D 是论文推荐落地的版本。
这两条路线后来怎么样了? DeepSeek-VL2 也引入了动态 tile,NVLM 团队后续转向更产品化的模型。技术路线没有变成教条,而是互相吸收。
原创文章,作者:guanweilu,如若转载,请注明出处:https://guanweilu.cn/article/387.html