Stability AI 与手动操作:效率对比实测
为什么我做了这个测试
上个月我接了个活:给一个本地咖啡品牌做视觉物料,要求三天内产出大约 60 张风格统一的图片——菜单配图、海报背景、社交媒体素材都得有。我的第一反应是拿起数位板自己画,但算了算时间:就算每张图只花 40 分钟,60 张就是 40 个小时的纯绘制工作量,还不算修改。三天,根本来不及。
所以我把这个项目当成了实验场:一半工作交给 Stability AI(主要是 SDXL 和后来的 SD3),另一半留着手动操作(Photoshop 手绘 + 素材库拼贴),然后记录每张图的真实耗时、修改次数和最终质量。下面是我的完整数据和一些踩坑经验。
测试环境
先交代一下我的配置,免得大家复现时结果差太远:
- 硬件:RTX 4070 Ti(12GB 显存)+ 32GB 内存
- 工具:ComfyUI(本地跑 SDXL)、Stability AI 官方网页版、Photoshop 2024
- 手动对照组:Photoshop 手绘 + Adobe Stock 素材合成
第一轮:生成速度对比
我挑了一个典型需求:“温暖光线的咖啡店窗边,一杯拿铁特写,浅景深”。
手动操作流程:
- 在 Adobe Stock 搜图、筛选:25 分钟
- 找到三张接近但都不完美的图,买授权:10 分钟
- 在 Photoshop 里抠图换背景、调色调统一:35 分钟
总计:约 70 分钟一张。
Stability AI 流程(本地 SDXL):
我的初始 prompt 很朴素:
a latte on a cafe table by the window, warm morning light, shallow depth of field, photorealistic
结果很差——杯子变形,光影也脏。这其实是我的第一个坑:SDXL 对长描述句不太买账,对关键词堆叠和权重语法反而更敏感。我改成了:
(coffee latte art:1.3), ceramic cup, (wooden cafe table:1.1), window light, golden hour, bokeh background, shot on 85mm lens, professional food photography
再配上 negative prompt:
deformed, extra cups, blurry subject, oversaturated, cartoon
每批出图 4 张(25 步,DPM++ 2M Karras 采样),一批大概 15 秒。第三批就出现了能用的图。总计:12 分钟,包括我改 prompt 和调参数的时间。
第二轮:风格一致性——这才是真正的分水岭
单张图生成快不算本事,客户要的是 60 张风格统一的图。这是我这次测试里最有价值的发现。
手动操作在这方面反而稳:我自己调色、统一光效,每张图风格偏差很小,但每张要花 60 分钟以上。
纯文生图的稳定性就差多了。我换了 10 个不同场景的 prompt,出来的图色调和质感五花八门。解决办法是用了三个技巧:
技巧一:固定 seed + 固定 prompt 骨架。 把最满意的那张拿铁图的 seed(比如 seed=192837465)固定住,只替换场景描述词。这样构图和色调的大方向能保住,但灵活性也牺牲了——换场景时 seed 的优势就打折扣。
技巧二(更有效):图生图 + ControlNet。 我先手工做一张“风格锚点图”,然后用 img2img,denoising strength 控制在 0.5–0.65 之间,再配上 ControlNet 的 depth 或 canny 模型锁住构图。这样每张图既有变化又不会跑风格。单张耗时大约 3–5 分钟(包括找参考构图)。
技巧三:LoRA。 项目后期我干脆用客户品牌色系的 20 张图训了个小 LoRA(本地训练,4070 Ti 上跑了大约 40 分钟),之后所有生成自动带风格。这笔前期投入非常值。
最终数据
| 项目 | 手动操作 | Stability AI |
|---|---|---|
| 单张首图耗时 | 约 70 分钟 | 约 12 分钟 |
| 风格统一后单张耗时 | 50–70 分钟 | 5–8 分钟(含 LoRA 前期投入) |
| 60 张总耗时 | 根本做不完 | 约 9 小时 + 4 小时准备工作 |
| 返工率 | 约 20% | 约 40%(前期)→ 15%(用 LoRA 后) |
| 手部、文字类内容 | 无问题 | 频繁翻车,必须手动修 |
我踩过的坑
别迷信一次生成。 前期我总想着“一个 prompt 出神图”,浪费了大量时间精调措辞。正确姿势是批量出图、快速筛选,把 prompt 调优时间控制在 10 分钟以内。
低显存记得开优化。 我一开始没开
--medvram这类选项(ComfyUI 里对应显存管理节点),12GB 显存跑 SDXL 的 1024×1024 偶尔爆显存。先降低分辨率,再用高清修复放大,比硬上大分辨率快得多。手和文字是重灾区。 60 张图里凡是出现人手或者画面内需要文字的,AI 出图八成要返工。我的经验是:这类内容直接手动画、手动贴字,别跟模型较劲。
生成 ≠ 完成。 AI 出的图几乎每张都得在 Photoshop 里过一遍:修瑕疵、统一色调、加品牌元素。我实际给每张图留了 5 分钟的后期时间——这是很多人测算效率时漏掉的一环。
诚实的结论
- 如果你要的是大量风格统一的商业素材,Stability AI 配合 LoRA 和 ControlNet,效率是手动的 6–10 倍,没有悬念。
- 如果你要的是精确控制、复杂构图、人物互动场景,手动操作仍然不可替代,AI 反而会拖慢你——你会陷入“生成 50 张挑不出一张能用”的泥潭。
- 前期学习成本是真实存在的。 我花在学 ComfyUI、ControlNet、LoRA 训练上的时间大约是 15 个小时。如果你的项目只有三五张图,不值得,直接手动或者用网页版付费生成更划算。
这个项目我最终是以 7:3 的比例交付的——AI 打底,手动精修。这大概也是目前性价比最高的工作流了。