1. 项目背景:为什么我要把电商主图生产“工业化”
先说结论:这件事的起点,不是“AI绘图很酷”,而是“人工做图太痛了”。
我手头同时运营着几个不同类目的店铺,SKU加起来几百个,每个月要上新的款式至少在30到50个左右。过去的主图流程是:找设计师排需求、等初稿、反复改文案、调背景、导出不同尺寸,再手动检查有没有错别字、有没有水印残留、有没有比例变形。一个品从需求提交到最终上线,运气好三天,运气不好一周。遇到大促前临时改款,整个链路直接卡死。
后来我尝试直接用图像生成模型一张张出图,效率是上来了,但新的问题更头疼:同一个系列的产品,风格飘忽不定——上一张是暖色棚拍,下一张就变成冷色科技风;同样的Prompt换个产品词,生成的构图完全对不上;更别提偶尔蹦出来的畸形手指、错误文案、缺胳膊少腿的商品主体。这种图别说上线,连内部审图那一关都过不去,人工一张张筛,跟自己做图也没差多少。
所以我开始思考:能不能把“生成主图”这件事,从“设计师手工活”改造成“工厂流水线”。
于是就有了这个项目——用多模态图像模型批量生产电商主图,核心抓手是两件事:Prompt模板化,以及自动化质检。模板化解决“风格统一、批量可复制”的问题,自动化质检解决“废片率不可控、人工审核成本高”的问题。这两个点一旦打通,主图生产就能从“一张一张画”变成“一批一批出”。
这篇文章不是讲理论,是我把这套流程在真实店铺里跑起来的完整记录。内容包括Prompt模板怎么设计、参数怎么定、质检流程怎么搭、踩过哪些坑,以及目前这套流程的边界在哪里。如果你想做同类的事,可以直接照着抄作业。
2. 整体架构:一条主图流水线是怎么拆出来的
2.1 先把“做图”拆成“工序”
传统做图,设计师脑子里想的是“这张图好不好看”。但一旦进入批量生产,就不能靠“感觉”驱动了,必须把每一个环节拆成可执行、可检查、可复用的工序。
我把整个主图生产流程拆成了五个环节:
- 产品素材准备:整理每个SKU的干净产品图、白底图、多角度图。
- Prompt模板生成:根据类目和风格预设,把产品词、场景词、构图词、光影词组合成标准化的Prompt。
- 批量出图:调用多模态图像模型,按模板批量生成候选图。
- 自动化质检:用规则脚本加视觉模型,筛查错图、畸形、文案错误、构图超界等问题。
- 人工终审与微调:自动化筛掉明显废片后,剩下的小批量候选图由人工快速挑选并微调。
这个拆法最大的好处是:每个环节都能单独优化。比如出图不稳定,不一定要换模型,可以回头改模板;质检漏检率高,不一定要堆人力,可以加规则。流水线思维的核心是“问题定位到工序”,而不是“图不好就重画”。
我当时特意用了一张表格来记录每个环节的耗时占比,跑完一轮后你会发现,真正的瓶颈往往不在生成模型本身,而在你Prompt模板的质量和质检规则的覆盖率。
2.2 为什么选“模板化”而不是“自由创作”
很多人玩图像生成模型,喜欢随手写Prompt,今天一个风格,明天一个风格,出来的图每张都“很惊艳”,但放在店铺里就是灾难——整个店铺视觉杂乱,用户刷到你的商品页和刷到一个地摊没什么区别。
电商主图要的是统一性、可预期、可复用,不是艺术表达。模板化就是把这个需求落到技术层面:
- 统一变量:把Prompt拆成常量部分和变量部分。常量是风格、光影、构图、画质等固定描述,变量只有产品词、卖点词、角度词。
- 保证可复制:换一个SKU,只需要替换变量,不需要重写Prompt。
- 方便调优:某个风格出图效果不好,只需修改模板中的常量部分,所有SKU同步生效,不用逐条改。
我见过一些人抵触模板化,觉得“限制了AI的能力”。但从工程角度讲,电商主图要的不是“上限高”,而是“下限稳”。模板化的本质是把模型的随机性摁在可控范围内,让每次出图都朝同一个方向收敛。
2.3 技术选型:多模态模型到底选哪个
多模态图像模型目前可选的范围其实挺多。国内外的服务商都在做,API能力大同小异,核心差异在三点:中文理解能力、出图稳定性、审图合规策略。
我当时筛选了几个主流的可用服务,逐一跑了50张测试图,评估维度包括:
| 评估维度 | 说明 | 我的权重 |
|---|---|---|
| 中文Prompt理解 | 能否准确理解“左打光”“浅景深”等中文描述 | 高 |
| 出图稳定性 | 同一Prompt多次生成,风格一致性如何 | 高 |
| 商品主体还原度 | 能否正确还原产品形态,不产生畸形 | 高 |
| 文案渲染能力 | 能否正确渲染主图上的促销文案 | 中 |
| 审查策略友好度 | 是否容易被误判为违规提示 | 中 |
| API成本 | 单张图综合成本(含重试成本) | 中 |
最后我选了以国产多模态模型为主要生成引擎的方案。原因很实际:中文产品描述、中文营销文案、中文Prompt,国产模型的理解更精准;另外API稳定性也扛得住批量调用。如果你做的是纯英文市场,也可以考虑其他模型,但核心方法论是一样的:先小批量测试,再决定规模化。
3. Prompt模板化的核心设计:把一句话变成一套工程
3.1 从“一段话”到“结构化模板”
早期我写Prompt是这样的:
一张电商主图,某个保温杯,放在木桌上,旁边有绿植,光线温暖,高清,好看。
这种Prompt的随机性非常大。模型会自由发挥构图、光线、景深、甚至杯子的形状。同一句话出10张图,可能3张能用,7张是废片。
后来我把Prompt拆成了结构化模板,大致分五个区块:
- 产品主体描述:产品名称、材质、颜色、形状、关键特征。
- 场景与背景:场景类型、背景色、环境元素。
- 构图与镜头:拍摄角度、镜头焦段、景深、主体占比。
- 光影与质感:光源方向、光比、质感、氛围。
- 画面与约束:画质、比例、负面约束(不要多余物体、不要畸形等)。
模板化之后,这五块内容组装起来是这样的:
【主体】一张“XXX(产品词)”的电商主图,产品为“YYY(材质/颜色/特征)” 【场景】放置在“ZZZ(场景词)”中,背景为“WWW(背景词)”,有“VVV(辅助元素)” 【构图】使用“45度俯拍”,产品居中偏右,占画面60%,浅景深 【光影】主光源来自“左上方”,光线柔和,高光柔和,阴影干净 【画质】4K超清,商品摄影风格,细节纹理清晰,整体色调统一这个模板的好处是:每个区块是独立的,想调整风格时改一个区块就行,不用动其他部分。比如从“暖色木桌”换成“冷色大理石”,只改场景区块。
3.2 变量池设计:让模板“活”起来
模板不是死文字,它的威力来自变量池。我按类目维护了一套变量池,比如:
场景变量池(以保温杯为例):
- 户外露营风:“放置在木纹折叠桌上,背景是朦胧的森林,有晨雾”
- 居家办公风:“放置在简约办公桌上,背景是白墙和绿植,有笔记本电脑虚化”
- 通勤随行风:“放置在汽车杯架上,背景是城市街道虚化,有包袋元素”
光影变量池:
- 暖阳感:“主光源来自右侧45度,色温偏暖,阴影柔和”
- 清冷感:“主光源来自顶部,色温偏冷,明暗对比明显”
- 高级感:“主光源来自侧后方,轮廓光清晰,整体低饱和”
构图变量池:
- 中心主图:“产品居中,占画面70%,背景简洁”
- 场景带入:“产品偏左下,占画面50%,右侧留白放文案区”
- 细节特写:“产品局部特写,占画面85%,突出材质纹理”
每次上新款,我只需要做两件事:从变量池里选值,填入模板。如果某个变量池出的图效果不好,就优化该变量的描述,而不是推翻整个模板。
3.3 负面Prompt和约束词:消掉一大半废片
很多人不注意负面Prompt,觉得“模型不会那么傻吧”。实际上,模型会。我早期生成保温杯主图,经常出现:
- 杯盖和杯身错位
- 杯身Logo文字乱码
- 多了一只不属于产品的异物
- 产品的倒影方向不符逻辑
后来我在模板末尾固定加一段负面约束:
【负面约束】不要多余物体,不要变形的手或肢体,不要错误的文字,不要水印,不要Logo乱码,不要镜面倒影错误,不要颜色偏移,不要模糊低清这段约束加上之后,废片率直接从50%降到30%左右,效果立竿见影。但要注意,负面提示词不是万能的,它更多是“减分项规避”,真正的构图和风格控制,还是要靠正向描述做扎实。
3.4 Prompt的“长度阈值”问题
我在实操中踩过一个跟“Prompt too long”相关的坑:模板变量太多时,拼接出来的Prompt会非常长,长到某些模型的API直接报错。
常见的报错是:
Your prompt was flagged as potentially violating our usage policy. Please try again with a different prompt.这个报错不完全是敏感词问题,有时候就是Prompt超长或结构混乱导致模型服务端的审查策略误判。我的处理方法是:
- 控制总长度:单个Prompt控制在200字以内,变量部分精简。
- 常量部分缩写:把“不要出现多余物体”这类长句压缩成“无多余物”等短词。
- 拆分生成:如果场景描述确实太多,就把“场景”和“光影”拆分到两个Prompt里分别出图,再后期融合。
4. 自动化质检:把“人眼筛选”变成“规则+模型”
4.1 为什么批量出图后,必须走自动质检
很多人在批量生成主图时,把注意力全放在Prompt上,出完图直接丢给人工审核。这个流程在几十张图时勉强能跑,一旦上了几百张,人工审核会崩溃——不是人不够聪明,是人眼持续看图会产生严重的视觉疲劳,很多畸形和错字会“视而不见”。
我自己有过一次惨痛经历:批量出了100张主图,人工审了两轮,结果上架后有用户反馈某张图的商品Logo反了。这就是人工审核的极限——它无法做到不遗漏。
所以我把质检拆成了两层:
- 规则质检:用程序判断图片的硬性指标,比如尺寸、格式、文件大小、是否含透明通道等。
- 视觉质检:用视觉模型做内容级判断,比如主体是否完整、是否有变形、是否有乱码文字。
两层质检叠加,不能说100%拦截所有问题,但能把漏检率压到极低水平。
4.2 规则质检:先挡住“硬伤”
规则质检说起来很简单,就是把图片当作文件来处理:
- 尺寸是否符合平台要求(比如淘宝主图建议800x800或750x1000)
- 格式是否为JPG/PNG/WebP
- 文件大小是否在合理范围(过大影响加载,过小可能压缩过狠)
- 分辨率是否低于预设阈值(比如低于720px直接弃用)
- 是否存在EXIF信息异常
这些规则写成一个脚本,批量跑一遍,速度极快,几百张图几秒钟就能过滤完。规则质检解决的是“能不能用”的问题,不解决“好不好看”的问题。
4.3 视觉质检:让模型“审图”
视觉质检我用了两种路径:
第一种:用视觉语言模型做“看图说话”式审查。把图片传给视觉模型,让它输出图片内容的文字描述,再用规则判断描述中是否包含问题关键词。比如:
- 描述中出现“多了一个物体”“多余的手”等词,判为废片。
- 描述中出现“文字模糊”“乱码”“拼写错误”等词,判为文案问题。
- 描述中出现“产品变形”“扭曲”“比例不协调”等词,判为畸形图。
但直接让视觉模型输出描述,不够稳定,不同模型对同一张图的描述差异很大。我的做法是用标准问题的形式让模型回答:
请检查这张商品主图,按以下维度回答: 1. 图中是否有且只有一个主体商品?主体是否完整? 2. 画面中是否有变形、畸形、多余物体? 3. 画面中的文字是否清晰、无错别字? 4. 构图是否符合商品居中、背景简洁的要求? 5. 整体光线是否均匀、无过曝或死黑? 对每个问题回答“是”或“否”。这种方式比开放式描述更可控,质检结果更结构化,方便后续自动化处理。
第二种:用图像分类模型做特征判定。如果对某些特定类目有明确的质检标准,可以训练一个轻量级的二分类模型,比如“合格/不合格”分类器。但这个方案对大多数中小卖家来说成本偏高,我目前只在数据量最大的一个类目上做了尝试,其他类目还是用视觉语言模型方案。
4.4 质检流程的编排:先规则后视觉
质检流程我编排成了一条流水线:
- 文件级规则质检→ 不合格直接丢弃。
- 尺寸和比例检查→ 不符合目标平台要求的,做等比裁剪或丢弃。
- 视觉模型初筛→ 判断主体完整性和变形问题,有问题的进废片池。
- 文字与Logo专项检查→ 重点看主图上的促销文案、Logo有没有乱码。
- 人工终审→ 每批图保留30%左右给人工快速过目。
为什么人工终审保留30%?因为视觉质检模型也有误判率,特别是对“好看”这种主观感受,模型很难替代人。但人工只看“候选通过”的图,工作量已经比全量审核大幅缩减了。
5. 实操实录:从模板到成图的全流程演练
5.1 一个完整案例:保温杯主图批量生产
我用一个具体案例来演示整个流程,产品是“简约白色保温杯”。
第一步,从变量池选择参数:
- 产品词:白色简约保温杯,磨砂材质,带黑色硅胶提环
- 场景:居家办公风(简约办公桌、白墙、绿植虚化)
- 构图:产品居中偏右,占画面60%,浅景深
- 光影:侧上方自然光,光线柔和,色温偏暖
- 风格:商品摄影风格,4K超清
第二步,组装Prompt:
一张白色简约保温杯的电商主图,磨砂材质,带黑色硅胶提环,置于简约办公桌上,背景为白墙和绿植虚化,产品居中偏右,占画面60%,浅景深,侧上方自然光,光线柔和,色温偏暖,商品摄影风格,4K超清,细节纹理清晰,整体色调统一。无多余物体,无变形,无错误文字,无水印,无Logo乱码。第三步,批量生成参数设置:
- 单次生成数量:4张
- 出图比例:1:1(主图标准)
- 模型版本:最新稳定版
- 随机种子:同一Prompt用4个不同种子
为什么用多种子?我的经验是:不要试图让模型一次出到完美图,而是同一Prompt多生成几张,再从中挑最优。AI生成不是“一次命中”的游戏,而是“批量采样+筛选”的游戏。种子固定时,同Prompt出图的风格一致性会好一些,但多样性不足,所以我每次用4个不同种子抽4张候选图,然后进质检流程。
第四步,质检输出:
- 规则质检:4张图尺寸、格式、分辨率全部合规。
- 视觉质检:第1张通过全部5个维度的检查;第2张“背景过于杂乱,有椅子的局部入镜”,判为不合格;第3张“杯身反射了窗框,影响主体识别”,判为不合格;第4张通过。
- 人工终审:选出第1张作为主图,第4张作为备选。
最终一张合格主图的生产时间:从Prompt组装到质检完成,不到3分钟。过去这个流程至少需要半天。
5.2 参数选型背后的逻辑
这里展开讲几个我做过的参数选择,以及背后的思考:
一次性生成数量为什么不是8张或12张?
模型生成的废片率直接决定你需要生成多少张。如果废片率30%,生成4张合格期望值约2.8张;但如果生成8张,合格的会更多,但同时审查成本、API费用、存储和管理成本都会上升。对我这种中小卖家来说,4张是性价比平衡点——既保证候选充足,又不至于管理过剩。
为什么用1:1比例而不是其他比例?
不同平台对主图比例要求不同。淘宝、拼多多主图默认1:1,京东和亚马逊部分场景需要16:9或4:3。我目前主力渠道以1:1为主,特殊渠道再单独做尺寸适配。如果你同时运营多个平台,建议在模板中直接加一个“比例”变量,换平台时一键替换。
随机种子要不要固定?
这个看场景。如果你是“同一个产品,出多张风格不同的图”,那就不固定种子,让模型多发挥;如果你是“同一风格、批量复制到多个产品”,建议固定种子,这样同一产品不同图片之间的风格一致性更高。我的做法是“每个产品固定种子区间”,比如SKU001用种子1001-1004,SKU002用2001-2004,既保持组内一致,又能让不同产品之间有辨识度。
5.3 批量上架时的“长尾校验”
批量生产完主图后,还有一个容易被忽略的环节:图文一致性校验。
很多AI生成的主图,图片本身质量没问题,但图片里的信息和商品标题、详情页描述不一致。比如标题写“带提环”,但AI生成的图上杯子没有提环;标题写“500ml容量”,图上杯身印了“350ml”。
这个问题的根源是:多模态模型对数值、文字这类精确信息的还原能力还不够可靠。我的补丁方案是:在质检流程中增加一项“图文一致性比对”,把商品标题和详情页的关键卖点提取出来,跟图片描述做比对,关键卖点缺失的图直接降级。
当然,这个方案不能百分百保证不出错,但能显著降低“货不对图”的投诉率。
6. 常见问题与避坑记录:那些不会写进API文档的事
6.1 “Invalid prompt”类报错:不一定是敏感词问题
这个坑我最初以为只是“Prompt里有违规词”,后来发现没那么简单。
我遇到过三种情况触发类似的报错:
- Prompt真的包含敏感词:比如涉及医疗、夸张功效、绝对化用语等。电商场景里特别容易踩,像“最佳”“纯天然”“治愈”这类词在部分平台的审查策略里可能被标记。
- Prompt超长或结构混乱:当Prompt过长、标点符号使用不规范、中英文混杂严重时,模型前置审查模块可能直接拒绝处理。
- 批量调用频率过高触发风控:短时间大量调用API,服务端可能临时性拦截请求,报错信息有时也是这个。
我的排查顺序是:先降温重试(等几分钟再发)→ 再精简Prompt → 再检查敏感词。不要一看到报错就删词,先排除限流问题,否则你可能白改了一堆原本没问题的Prompt。
6.2 主图文字渲染:AI画图最不靠谱的一环
到目前为止,AI图像生成模型对文字的渲染能力仍然是最弱的一环。特别是中文文案,稍微长一点的句子,大概率会出现笔画错乱、繁体简体混用、火星文乱码。
我的应对策略是:
- 不在生成阶段写入长文案,只保留一个简短品牌词或“NEW”等短英文词。
- 后期叠加真实的文案图层,用设计工具把促销文案、价格标签等后期合成到图上。
- 主图上的核心卖点用图标或图形来表达,不让模型直接渲染,因为图形比文字不容易出问题。
这个策略不是我一开始就想到的,是踩了无数次乱码坑之后总结出来的。现在我的主图生产流程里,Prompt模板中默认不写超过2个汉字以上的任何文案。
6.3 产品一致性漂移:同一个杯子,出的图像两个杯子
批量生产中最让人头疼的问题,是同一款产品在不同Prompt下生成的外观漂移。比如真实产品是圆底保温杯,AI生成图有时候会出现方底、细长、带花纹等“变异体”。
根本原因是:模型对产品细节的记忆不是通过单张产品图建立的,而是通过语言描述建立的。你描述得再详细,模型也可能在生成时加入自己的“想象”。
解决方案有几个方向:
- 使用参考图(图像输入)功能:现在不少多模态模型支持输入参考图,把产品实物图作为参考,再结合Prompt生成,主体还原度会大幅提升。
- 增加产品特征约束:在Prompt里把关键尺寸、材质、颜色、结构细节写清楚,比如“杯盖为圆形螺纹旋盖,杯身为磨砂材质,底部为不锈钢原色”。
- 人工终审把关:产品外观的一致性,目前还没有完美全自动方案。自动化只能筛掉明显畸形,细微差异还是得靠人眼对比实物图。
6.4 图片批量管理:被忽略的“脏活累活”
最后一个特别现实的坑:批量生成后,文件命名、版本管理、文件夹组织。这个听起来很无趣,但做不好全流程会乱成一锅粥。
我的命名规范是:
SKU编号_模板版本_种子号_生成日期_序号比如:
CUP001_T2_S1001_20250115_01.png这样命名的好处是:出了问题能快速回溯到“这个图用的哪个模板、哪个种子、哪一天生成的”。没有这个规范,几百张图堆在文件夹里,找一个图要好几分钟,修改一个模板后要重新生成哪些图也完全不可控。
整个项目跑到现在,我最大的体感是:电商主图生产从“艺术创作”变成了“标准化制造”。前者依赖人的灵感和状态,后者依赖一套流程和参数。这套东西不是让设计师失业,而是把机械重复的部分交给机器,把真正需要审美判断的部分留给人。特别是自动化质检,它看起来没有Prompt工程那么“炫”,但省下的时间成本远超预期。
最后分享一个我自己的小经验:不要一上来就追求“全自动无人值守”。最合理的节奏是,先用模板化减少重复劳动,再用自动化质检降低审核成本,最后才是逐步提升流程的自动化率。先跑通,再跑快,这套流程才能真正在你的业务里落地。