我最早用 AI 做包装设计的时候,被一张金灿灿的图气笑了。输入是「luxury skincare packaging, elegant, premium」,出来的是一个烫金浮雕配大理石底纹的盒子,光线模拟得像室内婚纱摄影——如果把这几张图拿给甲方,他们多半觉得你在羞辱他们的品牌。我一度以为是模型训练得不够好,后来翻出 CLIP 论文才明白,根本不是它笨,是它跟我想的不在同一维度。

先弄清楚现在主流的图像生成模型在干嘛。Midjourney、Stable Diffusion、OpenAI 的 DALL·E 3 都是一套几乎相同的管线:你写一句话,模型把它编码为语义向量;然后从一个充满噪声的图片矩阵开始,一步步去噪,最后还原成图像。扩散模型这一步,很像在脏玻璃上用手掌擦出水汽中的身影。每一步都略去一点噪声,直到轮廓清晰。具体过程可以想象成:你给模型看了一百万张「栗子蛋糕」的图片,所以它知道在什么形状下,该往哪个方向清理噪声。这个思路来自 Stable Diffusion 论文。
这里的关键是:文本提示怎么变成向量?答案是一类叫多模态模型的东西——CLIP 是其中最典型的代表。CLIP 把文字和图片同时映射到同一个高维空间:相同的含义靠得近,不同的含义离得远。换句话说,它用海量的带标签图片,把语言符号和视觉特征钉在同一张地图上。你输入「高端感」,模型找到的是一整片带有“高端”标签的图像的共同重心,而不是某个具体的高端设计。这个机制在 CLIP 论文 里有非常完整的描述。
看到这里你应该明白了:模型把「高端感」当成了一种统计显著的特征组合,而不是一种需要判断的审美概念。所以它会把几个高频出现的“高端符号”堆在一起:金色、黑色、大理石纹、衬线字体、强对比打光。但真正的品牌设计恰恰在反着来:高端不是把贵的东西全戴上,而是在克制中体现精准。表格左边是模型基于概率的平均偏好,右边是设计师基于上下文的判断。差距的根源是,训练数据里充斥着大量「伪高端」素材。你搜索“luxury packaging”,免费图库里那个金光闪闪的模板永远排在前面。模型分不清什么是真正的高端案例,它只知道这些元素出现的概率高。
| 视觉维度 | AI 以为的高端 | 设计师处理的高端 |
|---|---|---|
| 色彩 | 大面积金色、黑色、大理石纹、高光反射 | 低饱和配色、有节制的对比、材质固有色差异 |
| 排版 | 复杂衬线、纹样、烫金边框 | 留白主导、信息层级清晰、字距和行距的精确控制 |
| 材质 | 玻璃、丝绸、金属的纹理模仿 | 触感、开合方式、表面工艺、透光性等真实感知 |
那么怎么让 AI 更接近你的需求?别跟它谈感觉,要跟它谈材料、光线、构图。比如把「elegant luxury」改写成「matte black rigid paper box,blind embossed brand name,muted lighting,no text,large white space,subtle grain」。如果可以加负面提示,把「glossy, ornate, gold foil, gradient background」填进去。你会发现输出瞬间变干净。同时,Midjourney 的 style reference 和 Stable Diffusion 的 IPAdapter 都允许你垫一张参考图,让模型在参考图的风格框架内生成变体。这比形容词更有效,因为模型理解图像比理解语言更准确。但别忘了,你是在借用已有的图像特征做约束,而不是真的教会它“为什么这个包装显得高级”。Midjourney 官方文档里有这套参数的具体说明。
但品牌调性不是一组形容词,而是一个坐标系。以「张扬—克制」和「传统—未来」为轴,一个高端护肤品也许落在“克制但未来感强”的象限里,一个威士忌品牌可能落在“传统但具有仪式感”的象限。你没法通过提示词告诉 AI 这个坐标系,因为模型只能处理显式的视觉词汇,不能理解你的战略定位。哪怕你给它描述了一部分,它也看不到竞品、人群和价格带。换句话说,你可以让它生成一个“看起来像高端护肤品”的包装,但它很难生成一个“专门为你的品牌在下一个五年里制定”的包装。
而且,包装设计最终不是一张效果图。品牌视觉是一个系统:LOGO 的位置、字体家族、色彩体系、结构比例、系列产品的一致感,都需要被控制。AI 可以产出单张漂亮的视觉,但它不会记住你上一张图用了多大的留白。你让它生成十张同一品牌的包装,结果可能像十个不同的小品牌在打群架。为什么?因为模型没有跨图像的长期记忆,它只能根据提示和种子随机游走。如果你用固定 seed 或者局部重绘去维持风格,那这些操作本身已经是在做设计决策了。
包装的物理体验也不是效果图能表达的:纸张的触感、盒子的开启结构、内衬是否容易取出、在货架上多大距离能辨认。这些东西 AI 完全没有概念,它只会画一个盒子形状。你可以用效果图向客户演示视觉方向,但结构设计和成本评估还需要人来完成。
AI 生成的效果图不能直接用吗?
可以做提案阶段的灵感板,但直接拿去打样肯定会出问题。分辨率、出血、色彩模式、字体嵌入,这些印刷工艺参数模型统统不关心。它只是在像素世界里提供预测。
为什么有的设计师用 AI 能做出高级感?
因为他们懂设计,知道怎么把抽象需求翻译成模型能执行的描述,也知道从十张图里挑出哪一张有潜力。同样的模型,在不同人的手里输出质量差异巨大。
AI 以后能独立完成品牌视觉吗?
短期不能。因为品牌视觉要求你理解市场、用户、渠道、竞品,这些不是图像模型能感知的信息。如果未来多模态模型能同时理解商业逻辑和视觉文化,那就另说。
所以,AI 对「高端感」的理解,本质上是数据的平均值。它不知道是谁、为了什么人、在什么价格区间,才造就了这种高端。它只是把那些“看起来昂贵”的特征组合在一起。作为设计师,你现在的位置比模型重要得多:你是那个设定问题、筛选答案、最终承担品牌判断的角色。AI 给了你更多起点,但“知道哪里才是终点”这件事,依然只能由人来做。
最后再看一眼最开始生成的那张金光闪闪的图——现在我明白,它不是审美差,而是统计学上的诚实。它诚实地告诉你,网上的“高端感”平均长什么样。接下来怎么做,才是你的价值所在。
原创文章,作者:guanweilu,如若转载,请注明出处:https://guanweilu.cn/article/603.html