DALL-E 3 和 Midjourney 的路线差异:为什么效果差距这么大,底层技术选型不同

同样一句提示词:一只戴着礼帽的橘猫坐在咖啡馆窗边,窗外下着雨,背景是霓虹闪烁的纽约街道。DALL-E 3 给你的,是一张每个元素都严格到位的画——礼帽、橘猫、雨滴、霓虹,全都在。Midjourney 给你的,可能是一张光影绝美、构图讲究到可以当桌面的图,但仔细看,猫可能没戴帽子,窗外可能是巴黎。

AI technology illustration

这种差异不是玄学。两家公司在底层技术选型上走了完全不同的路,而这条路的分岔口,早在训练数据标注时就开始了。

2023年9月,OpenAI发布DALL-E 3时,在官方介绍里专门强调了一个词:re-captioning(重新标注)。简单说,OpenAI没有直接用互联网上的原始图片描述来训练模型,而是先训练了一个图像描述器,为每一张训练图片生成一段详细、准确的文字描述,然后用这些新描述去训练生成模型。

为什么要多此一举?因为互联网上的原始alt-text和图片标题通常太烂了。很多描述只有几个词,比如"猫"、"风景"、"IMG_2045.jpg",甚至还有大量完全无关的文本。模型在这种数据上学不到"猫坐在窗边"和"窗外下雨"之间的对应关系。OpenAI的做法,等于先请了一个"语文老师"把每张图翻译成一段几百字的细致作文,再让绘画学生照着作文画。

这个"语文老师"是什么?OpenAI没有公布具体架构,但从效果和论文线索推断,它很可能是基于多模态大模型(类似GPT-4)的视觉能力。这一步直接决定了DALL-E 3的文本理解上限

这意味着什么?意味着DALL-E 3的"听话"不是天生的,而是通过人工设计的数据标注流程硬生生教出来的。你给它的提示词越详细,它越能发挥,因为它见过太多"详细描述"了。

Midjourney那边,情况完全相反。这家公司没有OpenAI那么强大的语言模型团队,也没有公布任何技术论文。但它的效果摆在那——无论是人像、风景还是科幻场景,Midjourney生成的图像在美学上几乎碾压同期对手。

据Midjourney创始人David Holz在The Verge采访中透露,他们花了大量精力在数据筛选和人工反馈上。具体来说,Midjourney的训练数据经过了严格的美学评分筛选,只保留那些构图、色彩、光影都优秀的图像。同时,他们用了大量人工标注和评分来引导模型往"人类觉得好看"的方向走。

你可能会问,这不就是RLHF(人类反馈强化学习)吗?对,思路类似,但Midjourney把重点放在了视觉质量而不是文本对齐上。他们不是让模型听你的话,而是让模型画得好看。所以Midjourney对提示词的理解经常"开小差",但一旦理解对了,出来的东西就是壁纸级。

这解释了为什么Midjourney的很多用户喜欢用它出"概念图"而不是"精准插图"——它的模型天性就是追求美学上的最优解。

再从模型架构看。扩散模型是两家共同的基础,但细节分道扬镳。

DALL-E 3据说(官方未公开架构)采用了类似Imagen的路线——用一个预训练的大语言模型(比如T5)作为文本编码器,把提示词转换成丰富的语义向量。这种编码器对长句子、复杂关系、否定句、数量词都理解得更好。Imagen论文(PDF)就曾指出,相比CLIP,使用T5这样的语言模型能显著提升文本-图像对齐度。

Midjourney则更依赖CLIP(Contrastive Language-Image Pre-training)风格的文本编码器,配合精心调校的扩散采样参数。CLIP对文本的把握是"大致对",但在精确语义上不如T5。这也是为什么Midjourney经常搞错物体数量和位置关系。CLIP的原始论文(PDF)展示了它如何对齐图像和文本,但也暴露了它对复杂组合关系的弱点。

当然,Midjourney后期可能也有改进,但整体路线没变:用相对轻量的文本编码器,加上大量美学反馈,把生成质量推到极致。

我最早以为,DALL-E 3和Midjourney的差距是模型参数量的差距——OpenAI有钱,模型大,所以听话。后来我试着用开源的SD模型复现re-captioning的流程,才意识到:数据标注策略的影响,可能比模型架构还大

我用一个很小的扩散模型,把训练集里的短描述换成详细的合成描述,结果模型对复杂提示的遵循度肉眼可见地提升了。那一刻我才明白,DALL-E 3的"听话"不是魔法,而是先让语言模型把每一张图都"讲透"了。

维度 DALL-E 3 Midjourney
文本理解 强,能处理复杂句子和精确数量 弱,经常忽略细节或误解关系
视觉美学 中规中矩,偏写实但不够惊艳 极强,构图光影色彩俱佳
数据策略 合成详细描述(re-captioning) 人工筛选高质量图像 + 美学评分
文本编码器 类T5大语言模型(推测) 类CLIP模型(推测)
训练重点 提示词-图像对齐 视觉质量
输出风格 忠实、细节丰富 艺术化、氛围感强

现在回到标题的问题:为什么效果差距这么大?因为它们的优化目标根本不同

DALL-E 3优化的是"生成内容与文本描述的一致性",这是一个可量化的指标——你提示词里写了什么,模型就该画什么。Midjourney优化的是"生成内容的美学吸引力",这是一个主观但可以用人工反馈逼近的指标。两者在技术选型上的所有差异——数据标注、文本编码器、采样策略——都是这两个目标的自然延伸。

这也解释了为什么你用Midjourney时会觉得"它比DALL-E 3更有艺术感",而用DALL-E 3时觉得"它更听话"。这两个特性在底层是互相冲突的:追求极致的美学往往需要牺牲对文本的精确遵循,反之亦然。

那么,谁更好?取决于你要什么。如果你要生成一张用于广告文案的精确插图,DALL-E 3更可靠;如果你要一张氛围感十足的概念图,Midjourney是首选。目前,这两家也在互相靠近——DALL-E 3的后继版本在美学上不断进步,Midjourney v6对提示词的理解也明显加强。

但有一点值得注意:DALL-E 3的re-captioning思路已经被开源社区广泛采用(比如Stable Diffusion社区流行的"自然语言训练"),而Midjourney的美学反馈机制因为需要大量人工投入,至今没有被完整复刻。这也许是两家公司路线差异最深的地方——一个靠算法自动生成数据,一个靠人类审美定义标准。

未来,如果有一个模型既能像Midjourney那样惊艳,又能像DALL-E 3那样精准,那它大概率会同时采用这两种策略:用re-captioning解决文本理解,用大规模人类反馈解决美学偏好。但至少在当下,这两条路还处于各自探索的阶段,而它们之间的差距,恰恰是生成式AI从"能画"走向"会画"的完整光谱。

原创文章,作者:guanweilu,如若转载,请注明出处:https://guanweilu.cn/article/186.html

(0)
上一篇 2026年8月18日 上午12:58
下一篇 2026年8月19日

相关推荐