为什么我放弃了传统方案,改用 DALL-E
一切从一个加班的深夜开始
去年 11 月,我们团队接了个电商客户的项目:要为一款新上市的咖啡机生成大约 120 张产品场景图——咖啡机放在不同风格的厨房里、不同时段的自然光下、搭配不同配色的台面。客户的预算只够拍一组实拍图,剩下的全靠后期。
我最初的方案是走传统路线:实拍一组基础素材,然后用 Photoshop 合成。听起来可行,对吧?我干了十年设计,抠图、调色、透视校正都不在话下。
结果第一个场景我就干了 4 个小时。咖啡机的阴影方向和厨房背景对不上,金属机身的反射里没有环境信息,客户一看就说“假”。更糟的是,一改需求——比如“把厨房换成奶油色法式风格”——我几乎就得从头再来一遍。
那天晚上我算了笔账:120 张图,按这个速度要 480 个工时。客户的预算撑不起,我的腰也撑不起。
我是怎么转向 DALL-E 的
其实生成式绘图工具我早有耳闻,但一直有个执念:“生成的东西不精准,产品图差一个像素客户都能看出来。”直到我发现 DALL-E 3 可以直接在 ChatGPT 里用自然语言迭代修改,我决定认真试一次。
第一步:把产品“喂”进去
DALL-E 本身不能直接上传一张图就完美复刻你的产品(这是我踩的第一个坑,后面细说),所以我的工作流是这样的:
- 用实拍的咖啡机图作为参考
- 用文字尽可能精确地描述产品外观
- 生成场景后,主要靠把实拍产品抠出来合成
我的第一批提示词写得很烂,比如:
a coffee machine in a kitchen
出来的图咖啡机长得五花八门,没一台跟客户的产品对得上。这就是我说的坑:DALL-E 对具体产品的还原靠的是描述精度,不是魔法。
第二步:学会写“产品档案”式提示词
后来我改成这样写:
A modern espresso machine with a brushed stainless steel body,
rounded rectangular silhouette, a small circular LCD display on
the front panel, two orange accent knobs on the right side, and
a portafilter attached below the spout. The machine sits on a
white marble countertop in a bright Scandinavian-style kitchen,
morning sunlight coming from a window on the left, shallow
depth of field on the background.
关键心得有三条:
- 把产品特征固化成一段“标准描述”,每次复用,只改场景部分。我把这段话存在备忘录里,管它叫产品 DNA。
- 光源方向必须写。不写的话阴影经常乱来,后期合成会露馅。
- 明确构图和景深。"shallow depth of field on the background" 这一句能让背景虚化,正好掩盖生成图和实拍产品之间的细微差异。
第三步:建立迭代流程
DALL-E 3 最好的地方就是可以在对话里改。比如生成结果里窗户位置不对,我直接说:
Move the window to the right side and make the light warmer,
like late afternoon.
它会保留大部分构图只改局部。搁传统 PS 里这叫“重打光”,得重做整个光影层;在这儿就是一句话的事。120 张图,我大概花了三个工作日完成初稿,加上返工,一周内交付。客户只挑出 11 张需要修改,修改方式全部是自然语言描述,平均每张 3 分钟。
实际效果对比
| 维度 | 传统 PS 合成 | DALL-E 工作流 |
|---|---|---|
| 单张耗时 | 3–4 小时 | 15–30 分钟 |
| 改需求成本 | 接近重做 | 一句话迭代 |
| 场景多样性 | 受素材限制 | 几乎无限 |
| 产品还原精度 | 100%(实拍素材) | 依赖后期合成 |
| 总工时 | ~480 小时 | ~40 小时 |
注意最后一行,也是很重要的一行:产品还原精度。这是 DALL-E 目前最诚实的短板。
实用技巧总结
- 产品 DNA 描述要一次写好,反复复用。 颜色、材质、按钮位置、logo 形状全写清楚,越具体越好。
- 产品本体还是用实拍素材合成上去。 生成图做场景和光影底板,产品图层用 PS 贴上去再统一调色。这是目前最稳的商单做法。
- 在同一个对话里连续迭代,DALL-E 会记住上下文,比每次新开对话省很多描述工作。
- 批量生成前先跑 3–4 张找找感觉,确认风格方向对了再放量,不然 120 张里 100 张方向不对会很难受。
- 商用注意版权条款,确认你的账户类型允许商用授权。
诚实的局限
- DALL-E 画不好文字。包装上的品牌名基本必糊,文字部分还得靠 PS 后期。
- 精细的产品细节(比如按键上的丝印图标)会随机漂移。
- 同一个提示词的生成结果没法精确复现,客户要是要求“和上一版一模一样但只改一个细节”,有时做不到,只能重新生成几轮挑最接近的。
- 人物手部偶尔还是会出现诡异结构,涉及人物的场景要多筛查。
我的结论
我不是“抛弃”了传统方案,而是重新分工了:DALL-E 负责场景生成和快速试错,PS 负责最后的精修和合成。以前 90% 的时间花在场景搭建上,现在这 90% 被压缩到了 10%,我省下来的时间反而能花在真正体现专业度的地方——产品质感的打磨。
如果你也在做大量重复性的场景图工作,我的建议是:别纠结“生成图够不够专业”,先拿一个小需求把我上面这套流程跑一遍,用你自己的项目算一笔工时账。数字会比任何文章都有说服力。