你让AI做一件事:生成一段15秒的视频,画面是一只猫在弹钢琴,背景是肖邦的夜曲,旁白用中文说"这是我的杰作"。对用户来说这是一个需求,对模型来说这是三个完全不同的世界——像素、波形、文字。它们没有共同的物理形态,怎么保证画面上猫的爪子和旁白的内容互相对应?

我最早以为,多模态生成就是把单模态模型拼起来——LLM写文案,扩散模型画图,TTS读旁白,最后用剪辑软件拼在一起。这个方案有个专业名字叫pipeline。它有一个致命的问题:每个环节各自为政,最后拼出来的东西在语义上对不上。你让文案写"一只猫在弹钢琴",图像模型可能画出一只狗在弹吉他。
问题的根源在于模态的物理形态差异。文字是离散符号,图像是二维像素网格,音频是一维波形。你没法直接比较一个token和一个像素,就像你没法回答"一公斤和一米哪个更大"。
把不同语言翻译成同一种语言
2024年,复旦大学的AnyGPT论文给了一个极简的答案:既然没法直接比较,那就把所有模态都翻译成同一种语言——token。
这里的关键技术是离散化。图像怎么变成token?核心是VQ-VAE(后来被VQGAN改进)提出的思路:
- 准备一本码本,里面存着几千个向量,相当于几千个"视觉单词"。
- 把图像切成小块,每个小块经过编码器变成一个向量。
- 拿这个向量去码本里找最接近的向量,记下它的编号。
- 整张图就变成一个编号序列——图像token。
音频同理。SoundStream把音频流切成短帧,每帧压缩成一个token。一段10秒的音频变成一串几百个token。
于是文本、图像、音频都变成了整数序列。接下来就是Transformer的老本行——像训练GPT一样,在混合token序列上做自回归。AnyGPT的核心思想用一句话说就是:把所有模态统一成离散token,让模型从零开始学跨模态关联。
协调不是设计出来的,是长出来的
你可能会问:统一成token之后,协调机制是什么?答案会让你意外:没有显式的协调机制。
模型学的是跨模态的联合概率分布P(文本token, 图像token, 音频token)。生成时,每一步都基于前面所有模态的token做预测。文本token会"指导"图像token的分布,图像token反过来也会影响后续文本token。协调是在这个联合分布里隐式发生的。
这就像一桌人聊天,没有主持人,但对话自然延续——每个人说话都基于之前所有人说过的话。这个"基于之前所有内容"的机制,就是注意力。
这个领域让我最意外的发现也在这:我原来以为会有某种精巧的跨模态对齐机制,比如把图像和文本映射到同一个向量空间再显式对齐。后来读了Gemini的技术报告才意识到,Google的做法简单粗暴——数据够多、模型够大,模态间的关联自己就长出来了。
统一token方案的根本问题
离散token方案优雅,但有一个硬伤:离散化是有损压缩。一张1024×1024的图变成几千个token,每个token是码本里的编号——这相当于把一张照片用几千个词描述,细节必然丢失。
还有一个效率问题:图像token的数量远多于文本token。一句"一只猫在弹钢琴"是8个token,对应的图像可能是4000个token。模型自回归生成时,生成了3000个图像token之后,很可能已经忘了最开始那8个文本token说了什么——这就像一个人听你说了句话,然后埋头画了三个小时的画,画完已经想不起你原话了。
原生多模态和混合架构
Google的Gemini和OpenAI的GPT-4o走了另一条路:不是先把图像离线转成离散token再丢给LLM,而是在训练时就联合优化视觉编码器和语言模型,让模型直接从原始数据学习跨模态关联。这种方式保留的信息更多,模态间一致性更好,但训练成本极高,而且两家都不公开技术细节。
字节的Show-O代表了第三种思路:文本用自回归,图像用扩散,一个Transformer里两套生成头共存。动机很直接:自回归适合离散数据,扩散适合连续数据。强行把图像变成token,就像让一个说中文的人用英语思维想问题——能说,但别扭。
三种方案放在一起对比:
| 方案 | 代表 | 核心思路 | 优势 | 局限 |
|---|---|---|---|---|
| Pipeline拼接 | 传统方案 | 各模态单独生成再组合 | 简单,可复用单模态模型 | 模态间语义不一致 |
| 离散token统一 | AnyGPT | 所有模态变token,自回归生成 | 架构统一,支持混合生成 | 有损压缩,token效率低 |
| 原生多模态 | Gemini、GPT-4o | 统一编码器端到端训练 | 信息保留完整,一致性好 | 训练成本极高,不公开 |
| 混合架构 | Show-O | 文本自回归,图像扩散 | 各模态用最适合的生成方式 | 两套生成逻辑协调复杂 |
这个领域卡在哪
现在多模态生成还有三个核心难题没解决:
- 信息密度不匹配。图的token量是文本的几十倍,模型生成图像时很容易丢失文本指令的细节。
- 评估困难。文本有BLEU,图像有FID,但"图文一致性""音画同步"没有公认的指标。
- 数据稀缺。图文对、音视频对的数据量远不如纯文本,而且对齐质量参差不齐。
我的判断:AnyGPT这类离散token方案证明了"统一"的可行性,但生成质量还远不如单模态专用模型。Gemini这类原生多模态方向正确,但成本和封闭性限制了它的普及。未来两年最务实的路线可能是混合架构——文本走自回归,图像和音频走扩散,用一个大模型统一调度。
统一是趋势,但"所有模态都变成token"未必是终局。不同模态有各自最适合的表达方式,硬塞进同一个token空间是一种选择,而不是必然。这个问题的答案,可能还要等下一代架构来揭晓。
原创文章,作者:guanweilu,如若转载,请注明出处:https://guanweilu.cn/article/250.html