你有没有遇到过这种情况:同一个提示词“雨夜,霓虹灯下的便利店,电影感”,通义万相、可图、即梦各给你一张图,风格差异大到像三个不同人画的。你以为是它们审美不同,其实从模型诞生那一刻起,它们走的路就不一样。

今天我想拆开这三个模型的“脑子”,看看各自的图像生成技术路线到底差在哪。不是为了比谁强,而是为了让你理解:为什么不同模型擅长不同风格,以及当你想用它们时,该根据什么做选择。
通义万相:背靠阿里生态的“全能选手”,但技术细节像个黑盒
通义万相是阿里通义实验室推出的图像生成模型,最早在2023年7月公开。它主打中文提示词理解,支持多种艺术风格,还能做图像编辑。公开资料显示,它采用扩散模型架构——先给一张纯噪声图,然后一步步去噪,最终得到与提示词匹配的图像。
我最早以为通义万相就是DALL-E的中文版,但后来发现,它在处理“枯藤老树昏鸦”这种古诗词时,居然能画出那种意境,而DALL-E只会给你拼一张三个元素堆叠的图。这说明它在中文语义上做了大量定制优化。具体用了什么网络结构——U-Net还是DiT——官方一直没有详细公开。但从它衍生出的能力(比如局部重绘、风格迁移)来看,很可能是一个组合式生成框架,而不是单一的去噪网络。
你可以通过阿里云Model Studio调用它,链接在通义万相官方文档。对开发者来说,它最大的优势是阿里云生态,能和通义千问等模型无缝集成。
可图:把大语言模型塞进扩散模型,让AI真正“看懂”中文
与通义万相不同,可图(Kolors)从出生起就带着学术范儿。它是快手和新加坡国立大学等合作的研究成果,论文在2023年底公开,同时把权重和代码开源了。这在国内大厂里相当少见。
可图的技术路线非常清晰:视觉骨干用DiT(Diffusion Transformer),文本编码器用大语言模型ChatGLM。这两个选择都挺激进。传统扩散模型用U-Net做去噪,用CLIP做文本编码。CLIP的问题在于,它对复杂句子的理解很浅。比如“一只红色的猫在蓝色椅子上睡觉”,CLIP可能会把颜色搞混。而ChatGLM是经过海量文本训练的语言模型,它能真正理解句子的逻辑和指代关系。
所以可图对中文长句、成语、空间关系的理解能力特别强。我试过用“两个人在雨中打架,周围溅起的水花,背景是破旧的老街”这种描述,可图能给出很准确的画面。而一些国外模型会把“打架”理解成“跳舞”。
可图的DiT骨干则让它更容易扩展——Transformer的结构比U-Net更适合堆参数。论文里还提到,他们构建了一个大规模中英文图文对数据集,经过严格过滤,再用高质量数据进行精调。论文链接在这里:Kolors论文。
即梦(Seedream):字节的“暴力美学”,用数据和算力堆出效果
即梦AI是字节跳动的产品,底层模型是Seedream系列。字节在2024年推出了Seedream 2.0,支持中英文双语原生生成。它的技术路线也是DiT,但和可图有个关键区别:可图把文本理解外包给ChatGLM,而Seedream使用了一个统一的Transformer骨干,同时处理文本和图像token。
什么意思呢?就是说,Seedream把文字和图片放在同一个“输入通道”里,让模型自己学习它们的关系。这样做的好处是,文本和图像的对齐更紧密,不会出现“文本编码器懂了,但去噪网络没懂”的脱节。代价是模型规模更大,训练更难。
字节在算力和数据上确实豪横。Seedream的训练数据覆盖了海量中英文图文对,而且特别注重图片的审美质量。所以即梦生成的图片往往在色彩、光影和细节上更“好看”。你可以通过即梦官网体验:即梦AI。另外,字节也发布了Seedream的技术报告,但链接我记不清了,你可以搜索“Seedream”。
一张表说清三个模型的核心差异
| 维度 | 通义万相 | 可图(Kolors) | 即梦(Seedream) |
|---|---|---|---|
| 文本编码器 | 未公开(推测为中文CLIP) | ChatGLM(LLM) | 自研多模态Transformer |
| 视觉骨干 | 未公开(推测为U-Net或DiT) | DiT | DiT(统一文本图像) |
| 训练数据 | 大规模中文图文对 | 中英文图文对,高质量精调 | 海量中英文图文对,注重审美 |
| 开源情况 | 未开源 | 开源 | 未开源(API) |
| 核心优势 | 阿里云生态,功能全面 | 中文语义理解,可定制 | 图像真实感,双语原生 |
| 适合人群 | 阿里云开发者 | 研究者、自部署 | 创意创作者 |
为什么技术路线各不相同?
这背后是各家的战略选择。快手开源可图,是为了在学术界和开发者社区建立影响力,同时借助社区力量迭代。阿里选择闭源,把通义万相放进阿里云,目标是把技术变成商业服务。字节则把即梦和剪映、抖音生态绑定,追求的是内容生产工具的闭环。
从技术演进看,DiT正成为新主流。可图和即梦都押注了DiT,而通义万相的具体架构虽未公开,但从效果看也跟上了最新趋势。DiT的优势在于,它能复用NLP领域的成熟训练技巧,比如更好的学习率调度、更强的数据增强,而且参数量可以轻松扩展到几十亿甚至上百亿。
但这不意味着U-Net会被淘汰。在很多中小模型里,U-Net依然有它的效率优势。所以技术路线之争,本质上是效果、效率、生态的权衡。
Q1:DiT一定比U-Net好吗?
不一定。DiT在扩展性和长文本理解上有优势,但U-Net在低分辨率、快速生成等场景下仍然高效。比如一些实时绘画应用用的还是U-Net。
Q2:为什么可图对中文的理解这么强?
因为它用了ChatGLM作为文本编码器。ChatGLM本身是在中文上做了大量预训练的语言模型,它对中文的语法、成语、语境的理解远超CLIP。这相当于让一个“中文母语者”去读提示词。
Q3:即梦和可图都用DiT,为什么效果不一样?
因为DiT只是骨干,训练数据、损失函数、模型规模都不同。字节的数据规模更大,质量更高,所以即梦的细节更丰富。可图的开源版本则更注重可复现性。
Q4:通义万相的技术细节为什么不公开?
可能和阿里云的商业策略有关。闭源可以保护技术优势,同时通过API收费。但这也让外界难以深入分析它的技术路线。
我的判断:别只看技术参数,选工具要看你的场景
说了这么多,最后给你一个实在的建议。如果你是做研究的,想深入理解DiT和训练流程,可图是唯一的选择,因为代码和权重都开源。如果你是创业团队,需要快速集成图像生成能力,通义万相在阿里云上开箱即用,而且稳定性有保障。如果你是短视频创作者,需要大量高质量配图,即梦的审美和细节更接近专业设计。
但也要清醒地看到,这三个模型目前都还存在共同的短板:对物理规律的理解不可靠,容易在复杂场景中出现“穿帮”,比如手指数错、光影不自然。这些问题的根源在于,扩散模型本质上是在学习像素分布,而不是理解真实世界。所以,未来真正的突破点,可能是把3D、物理模拟和扩散模型结合起来。
技术路线各有千秋,但决定体验的还是细节。希望这篇文章能帮你做选择时,不只是看谁的样张更好看,而是知道背后为什么不同。
原创文章,作者:guanweilu,如若转载,请注明出处:https://guanweilu.cn/article/292.html