你用过 Midjourney 吗?如果你用过,你大概记得第一次使用时的困惑:怎么还要进 Discord?为什么不能像其他 AI 工具那样在网页上直接输提示词?更别说想把它集成到自己的产品里——官网翻遍了,找不到 API。

但奇怪的是,这个最不配合的工具,却是很多人心中出图效果最好的那一个。它不开源、不开放模型、不做 API,连官方网页版都迟迟不上线,可用户照样蜂拥而至。我最早以为这是技术领先带来的傲慢,后来研究了一圈,才发现这背后是一套深思熟虑的产品哲学。
这篇文章我想聊聊,Midjourney 为什么选择闭源?为什么这个策略让它体验最好?以及,它的局限在哪里。
一张表看清三家 AI 绘画巨头的路线差异
要理解 Midjourney 的选择,先把它放在整个 AI 绘画地图里看。目前最受关注的三家:Stable Diffusion、DALL-E、Midjourney。它们分别代表了开源、API、闭源三种极端。
| 维度 | Midjourney | Stable Diffusion | DALL-E |
|---|---|---|---|
| 模型权重 | 闭源 | 开源 | 闭源 |
| 官方 API | 无 | 无(社区有) | 有 |
| 主要使用方式 | Discord 机器人 | 本地部署 / 云端 | 网页 / API |
| 定制能力 | 低(只能调参数) | 高(可微调、LoRA) | 低 |
| 商业模式 | 订阅制 | 免费 + 企业服务 | 按量付费 |
| 用户门槛 | 低(但需 Discord) | 高(需配置环境) | 中 |
| 社区氛围 | 强(Discord 社群) | 分散(GitHub、HuggingFace) | 弱(API 调用) |
注意,Stable Diffusion 本身没有官方 API,但它的开源权重让无数第三方平台帮你封装好了 API,比如 Replicate、HuggingFace。而 Midjourney 连这条路都堵死了。
不做 API,不是技术不行,是算力太贵
你可能觉得,开放 API 不是能赚更多钱吗?事实恰恰相反。AI 绘画的推理成本极高,生成一张图需要多次扩散去噪,GPU 跑几秒钟。如果开放 API,外部程序会像洪水一样调用,Midjourney 的算力账单会瞬间失控。
Discord 机器人天然限制了调用频率——用户手动输入提示词,一次只能生成 4 张,而且还要排队。这种“低效”其实是在保护成本。
除此之外,不做 API 还有几个更隐蔽的考量:
- 保护品牌体验。API 会把模型变成“引擎”,用户对品牌无感。而 Discord 上的互动让用户直接体验 Midjourney 的审美,每一次生成都是品牌记忆点。
- 防止滥用。没有 API,自动化生成、批量生成被限制,能在一定程度上防止生成违规内容。虽然 Discord 也有规则,但控制难度低得多。
- 专注核心。API 需要文档、开发者支持、SLA,这些都会分散精力。Midjourney 团队一直保持很小的规模,专注核心体验才是他们的优势。
没有 API,反而成就了最好的体验
想象一下,如果 Midjourney 有 API,会发生什么?你会看到一堆文档、参数、鉴权、重试机制。你不再是“用”产品,而是在“调”服务。而 Discord 里,你只需要输入 /imagine a cat astronaut,剩下的交给机器人。这种极简交互,让任何人都能 30 秒上手。
更重要的是,Discord 的公共频道让你能看见别人生成的图。你不需要刻意学 prompt,光看别人的作品就能学到技巧。这种“围观”的社交体验,是 API 永远无法提供的。Midjourney 本质上是把“生成图片”做成了“大家一起画画”的社交活动。
闭源反而让 Midjourney 在美学上持续领先
Midjourney 最厉害的不是技术,而是审美。他们的模型在训练数据上做了大量美学筛选,还用了人类反馈来调整输出。闭源让这些“秘密”无法被抄走,也让团队能快速迭代,不需要考虑兼容外部插件。
从 V4 到 V5 再到 V6,每一代都有肉眼可见的提升。而开源的 Stable Diffusion 虽然迭代快,但版本碎片化严重——每个社区模型都有自己的风格,质量参差不齐。普通用户根本不知道选哪个。
Midjourney 的迭代速度惊人。从 2022 年 7 月 V3 到 2023 年 3 月 V5,再到 2023 年底 V6,几乎每隔几个月就有一次大版本更新。这种速度在开源社区很难做到,因为一旦模型开源,社区就会分叉,官方团队的精力会被分散。而闭源让 Midjourney 能集中所有资源,像打磨一个艺术品一样打磨模型。
我原来是开源党,直到我看到了 Midjourney 的出图
我最早是 Stable Diffusion 的拥趸,觉得开源才是未来。我花了一整天装环境、下模型、调参数,终于能生成图片了。那一刻很有成就感,但之后呢?每次想换个风格,都要重新下模型、改参数。而 Midjourney 的用户只需要输入几个词,就能得到比我折腾半天更好的结果。
这让我意识到一个残酷的事实:开源给的是自由,但自由是有代价的。绝大多数用户要的不是自由,而是“最好的结果”。Midjourney 的闭源,本质上是在替用户做选择——你不需要知道背后有多少参数,你只需要告诉我你想要什么。
闭源的代价:你无法把 Midjourney 嵌入你的工作流
如果你是一个开发者,想在自己的应用里集成 AI 绘画,Midjourney 基本不可用。没有 API,意味着你只能通过模拟 Discord 来调用,这违反服务条款,而且极不稳定。此时,Stable Diffusion 的 API 封装或 DALL-E 才是正解。
另外,Midjourney 对 Discord 的依赖也是一个风险。如果哪天 Discord 改变政策,或者出现更好的社区平台,Midjourney 需要跟着迁移。但至少目前,这种深度绑定反而形成了独特的社区壁垒。
常见误解:闭源 = 不能自定义?
其实 Midjourney 提供了“风格参考”“角色参考”“垫图”等功能,你可以通过图片来引导生成方向,虽然没有 LoRA 那么灵活,但已经覆盖了大多数创作需求。
常见误解:不开放 API 说明他们不想赚钱?
恰恰相反,Midjourney 是少有的直接靠订阅盈利的 AI 公司。他们不做 API,是为了避免沦为“算力供应商”,而是想成为一个被用户热爱的创作社区。订阅模式带来的收入非常可观,而且没有 API 的摊销成本。
写在最后
所以,Midjourney 的闭源策略,本质上是一种“产品力优先”的选择。它不追求平台化、不追求生态,只追求一件事:当你输入一个提示词,你得到的图能不能让你惊叹。
从商业结果看,这个策略成功了。它证明了在 AI 时代,有时候“不做什么”比“做什么”更重要。如果你正在做一个 AI 产品,不妨想想:你是不是为了让别人集成,而牺牲了最终用户的体验?
原创文章,作者:guanweilu,如若转载,请注明出处:https://guanweilu.cn/article/302.html