假设你是个电商运营。明天要上一款新的蓝牙耳机,平台要求主图必须是白底图。但你为广告投放准备了一张场景图——耳机摆在木质桌面上,旁边一杯咖啡,阳光从窗户洒进来。这种图如果交给摄影师拍,场地、灯光、模特、后期,少说也要五百块起步。要是产品有几十个型号,预算当场爆表。

所以当有人告诉你,AI 可以把白底图自动变成场景图,你很难不心动。但真正上手一试,事情远没有那么简单——你扔给 Stable Diffusion 一张白底耳机图,提示词写下“放在海边”,结果出来的可能是一个长着耳机纹理的石头,或是杯口扭曲到变形的咖啡杯。为什么?
为什么直接扔给 Stable Diffusion 会翻车?
因为图片生成模型不是 PS。它从纯噪声开始重建整张图,每一步都在根据提示词和输入图片的概率分布去“猜”像素。你给它一张白底耳机图,它内部会把这张图压缩成一组语义特征,再在生成时重新展开。问题在于,这组特征只记录了“耳机大概是什么”,根本没有精确到轮廓边缘、手柄朝向、光影位置。于是模型就把耳机当成一个模糊的语义概念,自由发挥。
我第一次做这个实验时,给模型一张白色马克杯的白底图,说“放在木头桌子上”。结果杯子变成了一个歪脖子壶,把手消失,杯沿也变了形。我当时很困惑:我不是已经把图给它了吗?为什么它不照着画?后来我去翻 ControlNet 论文,才意识到自己漏掉了关键一步——没有把形状信息“显式”告诉模型。
你需要的不是“换背景”,而是“锁住产品”
白底图到场景图,本质上是同一产品在不同环境下的“重渲染”。难点从来不是把背景做得漂亮,而是在生成过程中让产品本身的形状、材质、身份保持不变。目前业界有四种主流做法,先用一张表说清区别:
| 方案 | 产品一致性 | 环境控制力 | 最小数据量 | 上手成本 | 适合谁 |
|---|---|---|---|---|---|
| 直接图生图+提示词 | 差 | 弱 | 1张 | 低 | 快速做概念稿 |
| ControlNet 控制结构 | 中 | 强 | 1张+自动预处理 | 中 | 单品类生成场景 |
| DreamBooth / LoRA 微调 | 高 | 中 | 5~20张 | 中 | 固定产品形象的营销图 |
| LoRA + ControlNet 组合 | 很高 | 强 | 5~20张+预处理 | 高 | 品牌方批量生产 |
这四个方案里,直接图生图基本是碰运气,剩下三个才是真正可控的商业化路径。
ControlNet:给自由发挥画一条安全线
ControlNet 的思路非常直白:在生成过程中额外塞进一张“条件图”,例如深度图、边缘图或分割图。这张条件图像一根安全绳,强制约束生成器“主体的轮廓必须沿着这条线走”。它不改变 Stable Diffusion 原本的能力,而是在扩散的每一步,用条件特征去修正噪声预测结果,把采样路径锁在合理的范围内。
拿耳机来说。你先把白底耳机图跑一遍深度估计,得到一张深度图——越亮的地方离相机越近,越暗越远。这张图传给 ControlNet,等于是给生成器画了一条高低起伏的地形线。模型无论怎么生成,每个区域的深度都必须和这条线对齐。于是背景换成沙滩还是书房,耳机的立体轮廓都不会塌。
但 ControlNet 只锁住了“形”,没锁住“身份”。它不会在意这是哪款耳机,也不认识 logo 和表面纹路。要解决“它是它”,得靠下一个工具。
LoRA:让模型“认识”你的产品
DreamBooth 是第一个让我觉得“产品图有救了”的技术。它的思路是给模型引入一个独特的标识符,比如“ohwx product”。然后拿十几张产品白底图,配上“一张 ohwx product 的照片”这样的描述去微调模型。训练完成后,你只要说“ohwx product 站在沙滩上”,模型就会生成那个特定产品的沙滩图。
但直接全量微调模型成本太高,也容易让模型把原有能力忘掉。后来出现的 LoRA 解决了这个问题。LoRA 冻结了绝大多数参数,只训练一个低秩矩阵作为参数的增量。你用 5 到 20 张图、几百步训练,就能得到一个只有几 MB 的产品适配器。它在推理时像 U 盘一样即插即用,特别适合电商这种 SKU 成千上万的场景。
我见过最高效的商业团队,是把 ControlNet 和 LoRA 叠起来用:ControlNet 压住形状,LoRA 拉住身份。二者互补,效果比单独用任何一个都稳定得多。
一条真实可行的自动化工作流
我自己搭过一套,在电商场景下大致的流程长这样:
- 素材清洗。先用抠图模型——比如 SAM——把产品从原图里分离,生成透明背景 PNG,再合到纯白底上。简单产品一两秒就能抠完。
- 生成条件图。用深度估计和边缘检测工具,从白底图算出 ControlNet 需要的深度图和边缘图。
- 训练 LoRA。给每一张图加上自然语言描述,比如“一个白色陶瓷马克杯”。标签要多样化,防止模型把产品固定在同一个角度。
- 推理生成。写提示词时,把场景描述清楚,同时加上“white background”和“simple background”作为负向提示词。然后让 ControlNet 把深度/边缘条件压上去。
- 后处理。仔细检查 logo 和文字有没有变形。如果只是小瑕疵,用局部重绘或超分模型修一下就能交付。
这套流程跑起来,一张场景图的生成时间大约在 5 秒到 1 分钟之间,取决于迭代步数和分辨率。对比线下拍摄一天几千块的成本,效率已经不在一个量级。
哪些产品已经能自动化?哪些还不行?
我建议先按材质和形态把产品分个类,再决定要不要上这套流程:
- 硬表面产品(杯子、耳机、椅子、小家电):效果最稳,只要不过度反光,正常白底图就能生成不错场景。
- 软质产品(衣服、毛绒玩具):形状容易塌陷,需要额外训练和更多控制信号。
- 透明材质(玻璃、香水瓶、饮料瓶):折射和反射会让模型抓狂,经常生成实心玻璃或倒影错乱的图。
- 食品:AI 生成的食物很难有真实的汁水感和温度感,放大看细节就是“塑料食品”。
- 人穿产品(鞋、眼镜、包):一旦涉及人物,手指和脚踝就是重灾区,需要额外的人像控制模型。
换句话说,最适合自动化的是那些形状规整、材质不反光、不需要人物交互的日用品。
品牌方最关心的三个问题
是不是训练数据越多越好?
不是。LoRA 在 10~20 张数据时表现最稳。数据太少学不出特征,太多则容易过拟合,模型会把产品死死钉在那几个角度上,换个视角就变形。
生成的图能直接上线投放吗?
多数平台对 AI 图片没有明确限制,但品牌方自己要有质检流程。我的经验是:先把 AI 图当成高质量初稿,再安排修图师花十分钟美化光影和细节,这也比从零开始拍摄便宜得多。
ControlNet 和 LoRA 怎么选?
如果你只有一个产品、一张图,只跑控制条件就够。如果你需要同一个产品出现在百张不同场景里,还必须保持形象统一,那就训练 LoRA。两者不冲突,可以一起用。
我的判断:这波浪潮会冲到哪里
现在这套组合的能力边界,我已经看得很清楚:它能处理产品 90% 的视觉信息,但剩下 10% 的物理正确性非常致命。比如倒影的形状、透明材质的折射、还有产品底部与地面接触的那一小片阴影,这些细节靠现有模型很难做对,不是加大训练数据就能解决的。
但对品牌方来说,这已经足够产生价值。你要的不是一张 100 分的图,而是用十分之一的价格拿到 70 分的图,然后从多出几倍的素材里挑出能用的,这比等一个完美模型更符合商业逻辑。
所以,我的建议是:别幻想“一键生成完稿”的魔法。把白底图当原料,ControlNet 当模具,LoRA 当品牌印记,修图师当最终质检员——谁能把这套流水线组织好,谁就真正拿到了 AIGC 在电商里的红利。
原创文章,作者:guanweilu,如若转载,请注明出处:https://guanweilu.cn/article/427.html