MiniCPM-V 的技术路线:端侧多模态模型能做到什么程度

在手机相册里点一张照片,一个 App 直接念出上面的文字。这不是什么新鲜功能,百度、Google 都做了很多年。但你有没有想过,如果手机没有网,它还能不能做到?大部分 App 会告诉你:不行,这个功能需要云端模型。MiniCPM-V 做的是另一件事:把整个多模态模型塞进手机里,断网也能看图说话。

AI technology illustration

第一次听到这个事,我下意识觉得,这顶多是个玩具。一个能塞进手机的模型,能有多聪明?直到我翻了它的技术方案,才发现自己低估了这条路线。MiniCPM-V 不是把大模型"压缩"到手机,而是重新设计了一个"端侧原生"的多模态架构。

端侧多模态,难在三个"装不下"

多模态模型为什么都在云端?因为有三个东西装不进手机:

  • 模型装不下:GPT-4V 这种参数上千亿的模型,显存按 GB 算,手机内存直接爆。
  • 视觉 token 装不下:一张图片可能产生几百个 token,推理算力比读几十个字还大。
  • 推理引擎装不下:手机 CPU/GPU/NPU 都不是为 Transformer 设计的,需要大量适配工作。

所以,端侧多模态模型的核心问题不是"模型大不大",而是"怎么把视觉输入变得又小又准"。MiniCPM-V 的技术路线,就是围绕这个核心问题展开的。

MiniCPM-V 的解法:不造更大的模型,造更聪明的压缩

MiniCPM-V 的架构看起来不复杂:一个视觉编码器(SigLIP)负责把图像变成特征,一个压缩器(Resampler)把特征变成固定数量的视觉 token,然后喂给一个 8B 的语言模型。但魔鬼在细节里。

先说视觉编码器。它用的 SigLIP 是一种以 sigmoid 损失训练的 ViT,和传统 ViT 比,在同样参数量下能提取更稳定的视觉特征。但真正关键的是 Resampler——这是 MiniCPM-V 最核心的设计。

你可以把 Resampler 理解成"视觉摘要压缩器"。视觉编码器把图片变成了一堆特征块,比如一张 448×448 的图会产生数百个特征块。Resampler 用一组固定数量的"查询向量"去问这些特征:"这里有什么?那里是什么?"最后每个查询向量得到一个答案,汇总起来就是固定的 64 个 token。

这意味着:不管输入图片多复杂,视觉信息在进入语言模型之前,都被压缩成了固定长度。语言模型永远只需要处理 64 个视觉 token,而不是几百个。

但固定 64 个 token 有个问题:图片上的小字看不清。怎么办?MiniCPM-V 的做法是切块——把高分辨率图片切成多个 448×448 的块,每块单独编码、单独压缩成 64 个 token,最后再拼起来。比如一张 1344×1344 的图会被切成 9 块,总共 576 个 token。这个数字比直接暴力切 token 少了一个数量级,但分辨率一点没丢。

这个设计让我想起一个比喻:云端大模型像一个读过万卷书的博士生,端侧模型像一个只读过重点教材的高中生。MiniCPM-V 做的事,就是让这个高中生学会"划重点"——把一本书浓缩成一张 A4 纸,而不是逼它背下整本书。

从数据到训练:怎么让 8B 模型"开窍"

架构只是骨架,训练才是灵魂。MiniCPM-V 的训练分两阶段:

  1. 视觉-语言对齐预训练:让模型学会"看到图"和"说出话"之间的联系。
  2. 指令微调:用高质量指令数据,专门教它做"看得见"的事——识别物体、读文字、解释图表、回答图片相关的问题。

第二阶段更关键。8B 模型容量有限,不能像大模型那样什么知识都塞。对于"看不见"的世界知识,它不强求。

这正好解释了它和 GPT-4V 的差异:GPT-4V 是一个综合能力很强的全能型选手,MiniCPM-V 则是一个"偏科"的专门人才——在图像理解这件事上,它可以做得很好,但它的知识储备受限于 8B 参数。

我最早以为,端侧模型就是把云端模型的知识蒸馏出来,压缩成一个小的。后来发现不是这样。端侧模型的知识不是"压缩"出来的,而是"选择"出来的——它主动放弃了大部分世界知识,把所有容量都押在视觉-语言对齐上。这个思路,比单纯缩小模型要聪明得多。

端侧到底什么水平?对比 GPT-4V 不能只看分数

面壁智能在 官方仓库 里贴出了与 GPT-4V 的对比,声称在多个公开基准上打平甚至超越。如果你感兴趣,可以看看 HuggingFace 模型卡 上的详细评测。但如果你真去用,会发现差距依然存在。这不是说谎,而是评测指标和真实体验之间的差距。

下面这张表,是我理解的端侧模型和云端模型真正的区别:

维度 MiniCPM-V(端侧) GPT-4V(云端)
参数量 8B 超过 1000B
运行位置 手机 / PC,离线可用 数据中心,需要联网
隐私 图片不出设备 图片上传云端
延迟 本地推理,低延迟 受网络影响
知识广度 有限,依赖训练数据 海量世界知识
复杂推理 较弱,容易出错 强得多
单次成本 接近零 按 token 付费

注意最后一行:成本。端侧模型的边际成本几乎是零。你买了手机,模型就在里面,用多少次都不花钱。这在很多场景下是决定性的优势。

我的一点偏见:端侧模型的意义不是替代云端

很多人讨论端侧模型,总爱说"它能不能干翻 GPT-4V"。我觉得这个方向就错了。端侧模型和云端模型根本不在同一个竞争维度。

端侧模型解决的是"云端模型做不了的事":没网的时候、隐私敏感的场合、实时交互的场景。比如你在飞机上想翻译菜单,比如医院里处理患者影像不能上传,比如自动驾驶需要毫秒级识别——这些场景,云端模型再强也白搭。

反过来,端侧模型也替代不了云端:你要让模型写一篇学术综述,它做不到;你问它一个 2025 年的冷知识,它也不知道。两个路线是互补的,而不是谁取代谁。

真正让我感慨的是,端侧模型的进步速度。两年前,在手机上跑一个视觉问答模型还是不可能的事。现在,一个 8B 模型已经能离线读图、对话、看视频。技术路线的价值不在于它今天有多大能力,而在于它打开了一扇门。

你可能会问的几个问题

8B 模型为什么能塞进手机?

靠量化。把模型权重从 16 位压缩到 4 位,体积直接减到四分之一。MiniCPM-V 2.6 量化后大约 6GB,手机的高配版本能装下。推理时再用 NPU 加速,能保证基本流畅的交互。

端侧模型会胡说八道吗?

会,而且可能比云端更严重。因为知识少,遇到没见过的问题时,它只能靠语言模型的"语言惯性"硬编。这是所有小模型的通病,MiniCPM-V 也避免不了。

为什么不用 RAG 给它补知识?

可以做,但端侧设备上的向量数据库和检索质量都受限。目前 MiniCPM-V 主要靠模型自身能力,外部知识接入还在探索中。

它能看懂视频吗?

MiniCPM-V 2.6 支持视频输入,原理是把视频抽帧,每帧压缩成 64 个 token,再交给语言模型。但手机端的视频推理还很慢,实际可用性有限。

它的边界,就是整个端侧路线的边界

MiniCPM-V 能做到什么程度?一句话:它把"看得见"这件事做到了手机端,但"想得深"还做不到。

它擅长的是识别、描述、读图、简单推理;不擅长的是长视频理解、复杂因果推理、需要大量知识储备的任务。你让它看一张发票,它能准确读出金额和日期;你让它看一部两小时的电影,它根本记不住前因后果。

但我不觉得这是缺陷。端侧多模态的价值,本来就不是去和云端比智商,而是让"看图说话"成为手机上的基础能力,像蓝牙和 GPS 一样随叫随到。MiniCPM-V 证明了这条路走得通,这就够了。

原创文章,作者:guanweilu,如若转载,请注明出处:https://guanweilu.cn/article/298.html

(0)
上一篇 2026年8月26日
下一篇 2026年8月26日

相关推荐