文档大纲

AI 内容生成驱动的电商增长新模式

—— 根据 认知边界 杨寒培训笔记整理

第一章 核心提示词与一图胜千言方法论

1.1 淘宝电商主图六字提示词直接生成规范图

把"生成"两个字去掉,只跟模型讲"淘宝电商主图"这六个字,任何一张素材图丢给当前世界上最先进的模型,模型会自动领会"淘宝电商主图"这五个字的含义,自动产出符合电商规范的图,连文案和促销信息都能一并加上。这六字提示词加上"增加一些文案和促销信息"的附加指令,就能用同一张素材图一次生成三组不同变体。运营拿到这三张图直接丢进直通车,一个开一万的推广就能在短时间内知道哪个收藏加购好、哪个转化高。

电商主图输出的尺寸与平台要求的精确像素并不直接对应:淘宝主图常用 800×800,详情页常用 750 宽度,拼多多小黄图又有独立尺寸规范,但任何 AI 模型的输出尺寸都是模型训练阶段就固化死的几档,例如图像二模型 1:1 输出是 1024/2048/2880,3:4 输出是 1152×1536、1536×2048、2448×3264,谷歌 PRO 模型 4K 才是真 4K,GPT 系 4K 仍是"假的 4K"。所以正确做法是先生成、再裁切缩放,而不是去纠结为什么 AI 生不出 800×800 这种非训练尺寸。

1.2 附加要求指令实现一比一复刻解决模型不稳定

很多人做完东西后吐槽模型"总是在变",解法就是一句话附加要求:"保持内容和构图不变、保持角度不变、保持比例不变、保持光影不变、保持材质不变"。把这五个"不变"塞进附加指令,平面设计图就能做到一比一证实,这是解决模型不稳定的核心写法。

保鲜盒冰箱场景的案例更典型:店铺只有一张普通 SKU 主图,想生成九种不同规格的保鲜盒整齐放在冰箱里的场景图,文字描述再怎么写也写不全,AI 也不一定听话。正确做法是给 AI 一张参考线稿,提示词写成"生成九种不同规格的保鲜盒,整齐放在冰箱中的使用场景图,保持保鲜盒的高宽比例不变",图就规规矩矩出来了。所谓"一图胜千言",本质就是给到 AI 足够多的信息与上下文,一张图能讲清楚的事,胜过一千字描述。

1.3 场景与材质一键替换案例

雨靴卖家想生成各种极端天气场景,提示词就一句话:"把场景改成暴雨天气"。模型能力现在足够强,一句话就能把原图场景一键替换成暴雨天气,雨靴卖家的需求就这么简单地被 AI 解决了。

卖柜子的客户要换材质换颜色,提示词同样一句话:"把柜子改成黑胡桃木色"或"把柜子的颜色改成樱桃木色",AI 直接就改好了。从降本增效角度看,改个颜色极快,这绝对是降本利器,在做新产品、测新市场的阶段极其简单。内容之所以成为 2010 年之后或者 AS 时代更核心的生产资料,核心原因就是成本和数字变得极低,这意味着永远拥有更多向消费者展示产品甚至展示想法的机会——有客户问有没有黑胡桃木的,你直接给他生一张,甚至仓库里都没有这种货,放上 SKU 也会有人问、有人收藏、有人加购、有人愿意等 15 天运送。

1.4 单位时间迭代次数决定点击率上限

降本增效已经是电商企业的标配,但真正的护城河是速度。假设第一张图片点击率 1.5、第二张 2.0、第三张 2.5,什么时候能做出 2.8、3.0 的图,跟单位时间内迭代多少次有极其强的关系。只做三张就收手,点击率停在 2.5;再迭代十轮,就完全有机会做出比 2.5 更高的图。但很多企业做完三张就喊"可费劲了,多少钱一张",搭完钱就结束,直接错失迭代机会,等同学学会了他才发现领先不过三周到三个月。

能不能卖货的内容根本不是生成出来的,是测试出来的。以前测一张图要半天,做完上去测,测完一张就结束;今天运营把图丢上去开始测试,才刚刚开始,可以大量去测试。

所以运营活动里收完照片让客户给好评送美甲秀,再送视频、加一两块钱成本升个板子,三到五秒钟就能搞定的事,运营活动就起来了。能卖货的内容是测试出来的,迭代速度即护城河,这条逻辑在 2026 年 7 月以后只会更明显。

1.5 降本增效已是标配,速度即护城河

传统修图师岗位正在被 AI 替代:2023 年 AI 出来后,修照片打水印、修瑕疵这种岗位几乎已经慢慢消失。

用 AI 修复一张素人照,四张图总共四块,一个步骤一分钟四个步骤全搞定;同样这张图报给客户也许还是 120 块、还是 150 块,但成本降到原来的十分之一、二十分之一都不到。

AI 对电商美工行业的冲击是结构性的:如果公司原本八个美工,有了 AI 之后四个就够了,意味着现在有一半人就要被淘汰。因为很多人其实描述不出自己想要的画面是什么样子,他做美工无非是会个 PS、在网上找素材拼图,真正的想法停在老板脑子里。

未来不需要 PS 去生成,人是动了嘴就行——你公司的运营可能自己就能搞定主图,搞两张上去测一下,很快跑到高点击图片。主图不再是美工的专属,公司未来任何一个人都可能具备搞定高点击、高转化率图片的能力,还能生成配面指南一二三四写得清清楚楚。

第二章 AI红利与岗位重塑

2.1 AI能力平权打破地域人才壁垒

AI 带来的第一重红利是能力平权,它彻底打破了地域对人才获取的限制。

在江西小县城这样的地方,八千块、一万块、一万二的月薪都招不到一个优秀的美工或运营,因为优秀的人都已经流向北上广深。老板被迫去南京、杭州、北京、广州、上海开分公司,结果自己又不能常驻,两地奔波搞得非常累,效果还不一定好,运气差招到不靠谱的人甚至能把公司拖垮。

AI 出现之后,问题迎刃而解:公司员工只要会用 AI,就具备了很强的生产力,这就是第一层平权红利。

省会城市美工能做的图,县城员工用 AI 一样能批量产出;杭州运营能做的测图,江西员工借助 AI 也能同样跑。老板不需要再为招不到人或留不住人头疼,不需要再为开不开分公司纠结,只需要把现有团队武装上 AI 工具,就能产出原本只有大城市团队才能交付的内容质量。

2.2 参考图红利让小卖家站在巨人肩膀上

AI 时代第二重红利是参考图红利,核心方法论是一句话:参考图一,生成图二。这是当下 AI 最大的生产力杠杆,把小卖家和大品牌之间的差距直接抹平。传统时代你要做出一张高质量主图,需要摄影、模特、化妆、后期、场景、氛围、道具、服装搭配全套专业能力,工程人员没点水平根本整不出来;现在只需要找到一张你想要的大牌主图或行业爆款图,站在同样的肩膀上模仿学习,就能达到差不多的效果——不管是帽子的角度、模特姿势、情绪氛围、妆容质感,都能低成本复刻。

参考图的来源非常广泛:小红书、图定网、各种时尚杂志、走秀图库都是素材池。要的只是参考图里那种"看起来很大牌、很自信、很有精神状态、很饱满"的气质,而不是把别人的衣服直接套到自己模特身上(那样会侵权被投诉)。

用一张高质量白底产品图就够了——细节、材质、想要表达的东西拍清楚;如果没有实物拍摄,做家具、置物架、有些工业产品的商家,用渲染图也行,一样可以直接喂给 AI。整个生成成本极低:生一张图七分钱一个点,一张十三个点的图大概九毛多,算一块钱。一次生成九张图三乘三排版,每个动作成本约一毛钱。

2.3 2-3人小团队即可撑起大销售

AI 时代真正改变的是组织结构:过去一条电商链路上需要专职的摄影、模特、化妆、修图、运营、美工、设计,现在一个 2-3 人的小团队就能撑起几千万甚至上亿的销售。江西小县城企业主不再需要被组织瓶颈困住,不必为开不开分公司发愁,不再需要高薪去北上广深挖人,也不必再经历招不到人、培养不出人、人留不住人这种恶性循环。

参考图红利让小卖家第一次有机会站在行业巨人肩膀上。不是降本增效——这根本不是降本增效,而是几乎拥有了无穷无尽的生产能力。这种生产能力可以无限供应给主图的点击率测试、转化率测试、人群测试、场景测试,所有适配你这个产品的素材方向都能被穷举式遍历。数据会告诉你哪个场景好、哪个角度好、哪个配图转化高,而不是靠美工说这个图好看、那个图不好看——感性的判断让位于理性的数据决策。

2.4 创意生产能力从线性走向指数级

AI 让原本线性的内容产能变成指数级。原来一个运营搭十个场景就已经嫌麻烦不想干,搭两个测一下效果不好,再拆再搭,效率极低;现在 AI 直接帮你测,有多少个场景想法就能试多少次,人物数量从三个换成五个、七个、十个,气球颜色从蓝色换成黑色再换成粉色,场景从派对换成卧室、客厅、户外、公园,统统交给 AI 一次性生成。这种生产能力过去只有顶级品牌一年砸几百万拍摄才能实现,今天一个小团队用 AI 就能逼近同样的产能上限。

最关键的变化是创意方向的尝试成本被砸到地板价:之前一个新方向错了要拆场景重搭反复拍,现在一个不对换下一个 prompt 就行。生九个里面挑一个,挑出来的再单独放大成三张大图单独生,成本还是一块钱。这样下来的内容生产线,敢于穷举、敢于试错、敢于把不成熟的创意先低成本跑一轮数据,小卖家第一次和大卖家站在同一条起跑线上去测试市场反馈。

2.5 传统修图师岗位被AI替代已成定局

2025 年 10 月之前,AI 对电商企业的能力几乎不可用:它生不出准确的文字,需要大量后期硬修才能勉强用。

25 年 10 月之后,文字生成问题被彻底解决,AI 开始正式具备商用价值。文案 AI 自己发挥,排版效果已经接近真人设计师水平。

传统修图师的工作价值被严重稀释:换脸技术已经过时,不要再去做换脸——现在 AI 直接生成模特就行,生成出来的模特一致性更稳定、版权更干净。传统修图师赖以生存的抠图、修瑕、调色、合成、加文字这些技能,AI 已经能 90% 以上替代,剩下的 10% 是判断力和审美判断,这恰恰是老板和运营该做的事,而不是修图师该做的事。

第三章 批量生成与参考图工作流

3.1 职业形象照的 AI 替代与成本对比

销售员与客户经理的职业形象照,过去依赖线下拍摄。以某线下连锁机构为例,一次职业形象照拍摄报价 119 元,整套(工装照+形象照)累计花费一万多元。AI 介入后,只需要随手拍摄的现场照片作为输入,即可生成男装的杂志封面风、红袖的杂志封面风等不同风格的职业形象照——服装、造型、场景由 AI 自动适配,客户无需再到海马体等专业机构拍摄。服装风格不同,产出的封面气质也不同:男装风格偏性感,红袖风格偏柔美,直接用"生成一个男装的杂志封面"、"生成一个红袖的杂志封面"这类短句即可驱动。整个流程从客户随手拍一张照片开始,到产出多风格职业形象照,中间不再需要摄影棚与造型师。

销售人员与小姐姐的工装照、形象照,过去要跑去海马体拍,一次 119,全套拍完要一万多;现在用 AI,客户现场随手拍一张照片就能生成。生成一个男装的杂志封面,生成一个红袖的杂志封面,服装气质完全不同,但都是同一张随手拍作为输入。

3.2 穿搭衍生与小红书文案的俄罗斯套娃式迭代

以一张平面衣服图为基础,先让 AI 在左侧生成人物形象,在右侧生成同事与视频场景,产出小红书封面图。封面文字如果写不出来,直接交给 AI——AI 会自动加上小星星、小标签等具有小红书风格的视觉元素,产出后立即具备网感,避免人工撰写文案时缺乏那种"小红书味道"的尴尬。接着选定某一套穿搭(例如水手服),让 AI 衍生出四套部分穿搭方案:可以搭白袜、搭小红袋鞋、搭短裙、搭短裙外套。再从衍生方案中挑出最满意的一套,让同一女孩把这套穿搭穿在身上,继续生成三个不同姿势的造型,继而再叠加文化元素、分割图片、小红书风格图片,直至生成小红书文案——两百字左右的小红书风格文案。整个过程像俄罗斯套娃一样层层嵌套,每一层都基于上一层的结果做局部衍生。

AI 帮你把一张平面衣服衍生成四套穿搭,可以搭白袜、小红袋鞋、短裙、短裙外套;挑出一套不错的,再让同一女孩把这套穿搭穿上,生成三个不同姿势的造型,再叠加文化元素、分割图、小红书风格图,最后生成小红书文案。像俄罗斯套娃一样,一层套一层。

3.3 候选法取代决策法:以数据表现代替讨论方案

过去的工作模式是讨论完方向就开干,赶紧搞出来,谁可以放假谁收工。现在的工作模式是用候选法、用选择方法——和选款式的逻辑一样,只要生成成本足够低,就可以测试大量内容,通过数据表现决定每张图到底怎么做。决定未来方向的核心指标是单位时间内的迭代次数:三个月只做了三张主图、迭代三个月,和一个月一直迭代、一天产出三十张主图、上线即开始测试、一个星期迭代了一百多张主图,后者的成功概率必然高出几个量级。每一次衍生(从水手服到换女色外套,再到同一场景下三个不同姿势的造型)都是一次候选机会,数据会替人做出最终判断。

以前搞电商图片,讨论完方向就开干,赶紧搞出来就放假;现在用候选法、用选择方法,生成成本足够低时,测试大量内容,通过数据表现决定方向。三个月做三张图迭代三个月,与一天三十张图、一个星期迭代一百多张相比,后者的成功概率高出几个量级。

3.4 单位时间迭代次数即护城河

未来方向的核心指标是单位时间内的迭代次数。三个月只做了三张主图的人,与一个上午就迭代出一百多张主图的人竞争,后者的成功概率高出几个量级。这套逻辑适用于所有电商岗位:一个人可以搞定一款衣服的上架、商品详情、自动车测试、转化率优化、点击率运营、小红书种草、抖音内容生产——一个人就能跑通全链路。每个人都会成为"超级个体":一个人搞定一款衣服的商品上架、自动车测试、转换、点击率、小红书种草、抖音内容生产,一个人就能跑完全链路。

未来方向在哪?取决于单位时间内的迭代次数。三个月做三张图迭代三个月,与一个上午迭代一百多张图相比,后者成功概率高出几个量级。一个人可以搞定一款衣服的商品上架、自动车测试、转换、点击率、小红书种草、抖音内容生产,全链路一个人就能跑通。

3.5 模型能力跃迁与最新版工具预览

2026 年 4 月左右发布的最新模型(相比三个月前的能力又有大幅提升),已经可以完成:把人物搬到漫画场景、复杂的人物关系图(例如泰坦尼克号的人物关系图)、波斯猫带着你扣的扣子、杭州三天两夜女业公园三天两夜怎么游的攻略图、零售特价 DM 单(必须像超市的情络单)、五星电钻的品牌 logo 与完整 VI 套件、茶具品牌的 logo 与完整 VI、直播间画面、电影分镜脚本。

例如 GPT 系列的最新模型,只要你给一句"帮我设计一个五星电钻的品牌 logo,并且生成一套完整的 VI",品牌从想法到落地就只差一句话的距离。这本语文课本放在桌面上的桌面照片、泰坦尼克号的人物关系图,这种很复杂的人物信息文献图,现在全部交给 AI——AI 会自己去搜集、自己去理解有哪些人物、他们什么关系、最终输出人物关系图与这种视觉。

2026 年 4 月左右的最新模型,可以把人物搬到漫画场景、生成语文课本桌面照片、自动绘制泰坦尼克号人物关系图、设计五星电钻品牌 logo 与完整 VI 套件、生成直播间画面、输出电影分镜脚本。例如"帮我设计一个五星电钻的品牌 logo,并生成一套完整的 VI",品牌从想法到落地只差一句话。

第四章 精准表达与提示词设计原则

4.1 多生几张是写提示词的最简方法

AI 生成图片有随机性,产出 4 张里只有 1 张勉强能用,概率为百分之二十五。想要在公司里形成标准化、生产力化的 AI 出图流程,成材率至少要达到百分之五十以上,达不到的话要么是提示词不行,要么是模型不行,要么是流程不对,必须用这个东西做优化。

出图成本的核算不能只看单张费用,得乘以成材率。哪怕是三毛钱一张的低价,十张图里能出来一张能用,实际成本就变成三块钱。好的模型能把成材率推到百分之七十甚至百分之八十以上,五张图里有四张甚至五张都能用,这样单张成本反而比低价低质模型便宜很多。所以评估出图成本必须考虑成材率,单看某一张的费用没有意义。

教学交付的标准是五张图中四张能用,成材率达到百分之七十五以上。达不到这个标准就不让学员交付,因为方法还没有稳定。一个学员用全能图片 pro 模型,即使成本 0.124 美金一张、乘以 0.7 汇率折合人民币接近 9 毛到 1 块钱一张,用了 16 张都没出一张能用的,显然是哪里出了问题,而不是 AI 不适合产品。

出图张数成材张数单张成本实际成本
411 元4 元
541 元1.25 元
1601 元无限大

所以遇到一张不行不要纠结,再生一张;这一张不行不要纠结,再生一章。不要老是纠结成本收一句考虑的问题,纠结一个 AI 适合不适合的内幕,而是要多生几张以对冲 AI 的随机性。

4.2 用参考物替代尺寸让 AI 视觉感知产品

铲子产品的学员案例很有代表性。最初提示词是这样写的:这是一个单手,可以持我的铲子,保持铲子细节不变,生成使用产品图。改提示词后又写成:这是一个单手,可以持过的铲子,保持铲头的外观不变,技术感长度不变,手里不变,这些使用成品图。即使用了全球最好的模型全部都不行,身上 16 张出来没有一张能用的。

问题出在原图角度:从商家主图下载下来的铲子图片角度刁钻,下面还缺一脚,不是最佳表达角度。AI 是用看的而不是用想的,你觉得铲子细节 AI 都知道,但你给的也就只是一张图加一些文字,AI 不见得就能在这个点上明白。所以需要想尽一切办法让 AI 明白你想要什么,给了它不能明白,大概率是很低,明白了大概率是很高。

解决办法是去搜索里找植物,这个铲子叫挖野菜神器或者平州厂,找一张最佳角度的白底图给 AI。比如看到参考图中产品与原图对比,两张图的区别只是角度不同,下面好像缺一脚;这一张角度更容易理解这个铲子造型,提供了拍出来的最佳角度,反正更容易表达这个铲子的造型。换了角度之后铲子基本上是对了,使用铲子基本上也就出来了,所以你换到肉的(合适的)一个地方,铲子造型就都对了。

这就意味着不要觉得我知道那些细节。你知道不代表 AI 都能知道,你给 AI 的也就是一张图,给的也就是一些文字,AI 不见得就知道细节。所以要把产品拍清楚、要拍出最佳角度的参考图,而不能用随手拍的角度图去为难 AI。一点点角度的差异就会让 AI 把你的造型理解偏掉。

4.3 组合图作为单一素材减少 AI 理解偏差

柜子有不同规格,一乘二、二乘二、三乘二、四乘二,每个柜子单元格子尺寸都一样。最初做法是给 AI 传四张图,这是四乘二的、二乘二的、三乘二的、一乘二的,然后写提示词把柜子组合起来,保持柜子自己的结构不变。这样出来的结果不行,因为每个柜子理解它可能都理解得不一样,中间就会有偏差。

优化方法是把四个柜子先拼成一张图,提示词中明确图中是四个柜子,因为组合好了,就跟他讲图中是四个柜子,每个柜子的单元和尺分都是一样的,柜子分别是一层二、二层二、三层二、四层二的单元,生成一张柜子的组合图场景照片。提示词经过清晰规划后写明了生成一张柜子组合图,需要包括全部四个柜子,按高低组合排列。

传图方式AI 理解次数单次偏差组合偏差
4 张单图分四次4 次小大
4 张拼成 1 张1 次小小

这样不用每次给 AI 讲每个柜子一乘二、二乘二、三乘二、四乘二,只要写明白四个柜子每个词都是一样的就足够了。把四张图当成一个产品,你就给它讲清楚了产品是什么。怎么给它讲呢,四个柜子每个词都是一样的,一乘二、二乘二、三乘二、四乘二,所以虽然有时候你觉得灵活一点,想灵活点,但不灵活的时候等于卖了柜子的这四个柜子,就一个、两个、三个、四个,就分别给四张图。

这种方式本质上是简化给 AI 看的信息量。它是四次不同去理解,每一次理解都不同,中间就会有偏差;但把四张图拼成一张图给到它,AI 就完全理解了,自然就会起(自动对齐),也不用去给它讲什么对齐不对齐。它知道每个单元柜都一样的,组合起来,自然就会规整。

4.4 先想清楚需求类型再写提示词

提示词之前必须先想清楚自己到底想要什么。如果你都不知道你想要什么,就写不出来这么一句话。这是一个给别非常强化的、需要给他的一个离去的指引,或者离去的要求,也是你的需求。可能的需求类型包括生成模特儿产品图、产品使用图、前后对比效果图、电商主图这几大类,要把这个拍清楚才能下笔。

AI 给你东西,它就能明白,它就能明白,给到超出预期的东西;它不明白,它就不明白,它跟个傻子一样。所以想要把 AI 用起来,就是想尽一切办法让 AI 明白你想要什么;你给它东西,AI 是否真的就在这个点明白,决定了产出质量。

具体实操中,以柜子组合图为例,提示词不能只是简单的展示指令。合格的提示词需要涵盖:主体构成(如图中是四个柜子),内部约束(每个柜子的单元和尺分都是一样的),尺寸规格(柜子分别是一层二、二层二、三层二、四层二),产出类型(生成一张柜子的组合图场景照片),构成要求(需要包括全部四个柜子),排列方式(按高级组合排列)。这几条都需要讲清楚,缺一条 AI 都可能理解偏。

观察橱柜知道,前面用 PS 自由拼图工具做了将四张柜子图拼成一张的处理,这也是一种不需要动用 PS 的高效方法。提示词前置就是先把图准备好、用组合图让 AI 一次理解整体约束,再明确自己的需求。整体一套柜子卖的是家具和跟家庭环境有关系,既然是家居场景,讲清楚里面要包括礼品栏上面写好了文字这样的元素,因为这就是一个礼品栏的照片。

4.5 分步生成避免一步到位偏差

能力不足时一次提示词很难到位,需要多分几个步骤。以柜子组合图为例,先分成几个步骤完成:第一步先把柜子组合起来,提示词是组合四个柜子、把四个柜子组合成一张图,组合四个柜子,为什么拼成一张图呢,就是很懒、我有点懒,不想每人传四张图、给一张图就行了,准备好了就给一张图,把四个柜子给它放一起了。

第二步为了让画面增加一点生动感觉,希望增加人、增加人物,在这里面增加人物,会更加动感、更加有生活气息。提示词是增加一个亚洲女性在地产上阅读,有祭坛有柜子,你这个说了,那么这个观察看书吧,这个人阅读。生成结果是合格的。

第三步调整人物位置。生成结果是怎么样?其实有很多企业做这个内部的,根本判断不了。只能说好看、感觉好像还行,或者不好看。实际是什么的问题,从我的角度来表现也不耐心,稍微看起来反正不是我心中想要的这样子。不行的话换不同的阅读,他又往前坐那边了,反正总是看起来跟这个画面不和谐。长时间来不和谐那就继续找办法,找想法。

第四步加上动感效果。提示词是画面中有人物种过虚化的效果,就有点动感。生成结果是人物虚化,感觉这个放到后面有点感产品。第五步调整人物位置。把人物移动到画面的最右边,移到最右边去但是一个虚化的人都能走过去,所以好像这个画面就一下子动起来了、镜中有动了。

最后加营销文案。同一张图AI完全能理解这是一个什么样的产品,不需要再用文字描述这是收纳柜。提示词只给六个字(理想生活随心收纳、北欧创意收纳等),AI 自行发挥后产出完整文案配图。这种分步骤迭代的好处是每一步都在解决一个特定问题,不会因为提示词过长导致 AI 顾此失彼。

4.6 多步骤迭代与跨场景换风格

迭代次数上去之后,出图成本变得极其便宜、速度极其快,迭代速度会非常快。所以以同样一个东西,我们可以迭代非常多次,加上人的剪辑率会高一些。多个营销文案(理想生活随心收纳、北欧创意收纳、模块化生活创意收纳)哪个对点击率有帮助,又可以再次去测一层。所以文案不是简单的两字之间的降级,它在这种图像的局生成以及图像的局部迭代上速度会加快,这个速度会换夺(换取)竞争力。

解决完人物问题后,可以继续迭代换场景风格。比如能不能把它变成北欧的风格,就把衣柜变成北欧;觉得这个北欧风格还不错,但是这个沙发好像有点差点意思,我希望那是那种意识的皮翼沙发,那么这是个布翼沙发,就把蓝色的沙发修改成黑色的、棕色的皮翼沙发。同样一个位置,做出北欧风或皮翼沙发的多版本。两张图哪个点击率高,需要靠数据决定。

数据决策方法是把两张图都放上去、每个人展现、五个展现、一百个展现、五个展现、一百个展现,都打一百个人展现,打个一百个展现进来,看一下哪个点击好、哪个手段好,靠数据去决定最后的结果。所以你觉得这个图好看的吧,这个简洁,都没有用,最后是看数据做法。结果好就固化下一个流程,在你公司再去推进以后都做这个风格;这个风格不好就作为别的东西去做。

光影也可以迭代。增加不同光影,正常光影画面平平的、没有那么好看、差那么点意思;加光影之后就有清晨时光的感觉。原来就理解什么叫清晨时光,质感会更强烈一些。当然可以改成夜晚的场景,甚至做一个使时、让这个时间从早上变到晚上。这都是通过参考图中所有的物品、找出自己需要的物品,看其他企业如何操作,然后把做法迁移过来,跨业找创意找想法,其实有时候是很有惊喜的。

第五章 成材率评估与数据驱动测图

5.1 成材率是判断生成流程是否健康的硬指标

成材率指在一次批量出图任务中,最终可用于电商上架的有效图片占总产出图片的比例,行业默认门槛是 50% 以上。

如果单次九宫格出图 9 张里只能选出 2-3 张能直接进入详情页的成品,意味着提示词结构、参考图选择或模型参数仍存在系统性问题,需要回头复盘工作流而非继续硬跑。

出图过程看似是"按一下回车",但其背后是提示词模板、参考图特征、模型版本三重变量叠加,任何一个变量偏差都会导致成材率塌方。

以单张生成成本约 1 元、九宫格一次约 9 元计,若成材率仅 30%,意味着拿到一张可用主图的实际成本约为 3 元,接近传统修图师单张报价;只有把成材率稳定拉到 50% 以上,AI 才有真正的成本优势。流程稳定的团队可以把成材率推到 70%,再叠加测图淘汰的废片,最终单张可用主图的真实成本可压到 1.5 元以内,这才是 AI 替代修图师的盈亏平衡点。

5.2 用单张成本乘以成材率反推真实投入

总成本公式为"单张生成费用 ÷ 成材率",这一公式直接决定了 AI 工作流的经济性上限。

很多中小卖家只盯着"出图快"却忽略成材率,跑了 100 张图只选出 10 张,等于把成本放大了 10 倍,反而比找美工更贵。判断工作流是否值得跑,先算这个比值:九宫格单图成本 1 元、成材率 60%,则真实成本约 1.67 元;成材率掉到 30%,真实成本立刻飙到 3.33 元。

反推逻辑同样可以用来筛选产品:如果某个类目整体成材率长期低于 40%,要么换提示词模板,要么承认该类目不适合纯 AI 出图,转而采用人机协作模式。卖家不必追求 100% 自动化,而应让 AI 跑能跑的产品(如坚果、清洁剂、五金工具这类标准化品类),把必须人工介入的留给人。

5.3 测图计划是验证图片好坏的唯一标尺

测图即把同一款产品的多张候选主图,放进直通车或万相台等付费工具,设置相同的人群标签、出价预算与时间窗口,跑出真实的点击率与转化率数据,用数据而非审美来决定主图去留。常见做法是把 4-6 张候选图(含参考图一、生成图二、对手主图各 1-2 张)同时投放,预算 100-200 元,跑 3-5 天即可看出显著差异。

这一逻辑的背后是:中小卖家靠经验选图常常输给资深运营的数据直觉,因为头部运营可能看不懂 AI 生成逻辑,但平台后台的点击率不会骗人。很多中小卖家反而能跑出爆款,正因为他们愿意拿真金白银去测图,而非迷信某个运营的"我看了觉得行"。

5.4 不要把图片效果押注在平台智能推广算法上

不少卖家寄希望于"图片差一点没关系,平台算法会自动帮我们推给对的人",这是典型的偷懒思维。算法只能放大已有优势,不能凭空制造点击率:一张主图若在测试期点击率长期低于类目均值,系统会判定该创意劣质,后续即便提高出价也难以获得曝光。点击率是电商流量的第一道门槛,过了这道门,转化率、客单价才有意义。

AI 出图真正的护城河是速度:同样花 200 元测图,传统流程一周出 5 张候选,AI 一天就能出 50 张并完成投放,迭代速度相差 7 倍。这种速度优势让中小卖家可以在两周内测完一个完整类目的所有卖点变体,找到爆款图片的概率远高于一个月只测几张的传统团队。

5.5 资深运营做不起来反而中小卖家爆款案例

数据驱动的逻辑下,经验反而可能成为包袱。某年某月某类目头部店铺的资深运营坚持认为某款产品主图应该用白底平铺,因符合平台"干净"美学;而隔壁的中小卖家把同样的产品换成俯拍场景图(参考某个爆款零食的画面),同样投放预算下点击率高出 3 倍,一周内冲上类目 Top 10。这一案例的核心不是审美对错,而是后者愿意用测图数据说话。

类似案例在食品、清洁、五金等标准化品类高频出现:中小卖家没有"品牌调性"包袱,可以快速复制对手爆款构图,再通过 AI 改人群、改卖点、改背景,做出 10 张变体同时测图;头部店铺往往被 VI 系统、设计师习惯锁死,迭代慢一拍就错失流量窗口。

5.6 测图淘汰下来的废片也要反哺提示词

测图结束后,点击率最低的 2-3 张图片不能直接删除,而要回头分析:为什么这张图点击率低?是背景杂乱、卖点不突出,还是产品本身在搜索结果页的展示效果差?把这些"失败特征"汇总,反向修正提示词模板。例如连续 5 张俯拍图测试点击率都低,说明该产品不适合俯拍,下次出图应改回 45 度角或平铺。

这个闭环是 AI 工作流持续优化的关键:成材率负责"能不能用",测图负责"用了有没有效",废片分析负责"如何让下一批更好用"。三者缺一不可,只看前两步而不做废片复盘,工作流会很快撞上天花板。

工作流环节评估指标健康阈值异常处理
批量出图成材率≥ 50%低于 50% 立即复盘提示词
单图成本总成本 = 单张费用 ÷ 成材率≤ 2 元超过 2 元评估是否转人工
测图投放点击率≥ 类目均值 1.2 倍连续 3 张低于均值换方向
测图周期迭代周期≤ 7 天超过 7 天提速提示词模板
废片复盘反哺提示词频次每周 ≥ 1 次缺失则工作流停滞

第六章 跨类目参考与差异化卖点提炼

6.1 跨类目借构图做参考图

跨类目借图是中小卖家突围的核心方法之一。阿里健康店铺的煲汤图与坚果类目并非同一赛道,但其排版逻辑、构图角度、文案位置均可被提取出来作为参考图二,只需把文案换成"精选大核桃仁",把产品换成核桃,即可在一张白底主图上快速迭代出新的素材。AI 模型的灵活性使得跨类目参考几乎无门槛,即便两张图所属商家不属于同一品牌带,只要构图合理,就能直接套用。

这种做法的关键在于只取参考图的"排版骨架",而非复制具体内容。生成新图后,文案可单独迭代替换,图片本身的视觉角度与色彩布局已经验证有效。先参考图二生成新图,再针对文案做二次迭代,迭代速度极快,几乎可以在几分钟内完成一版新素材。

工作流:

  1. 选定跨类目参考图 → 提取排版骨架
  2. 图二生成新图(保留构图,替换产品/场景)
  3. 二次迭代替换文案
  4. 上传测试,观察点击率与转化率
  5. 效果不佳时再次微调

6.2 场景需求驱动差异化卖点

通过场景需求来围绕差异化卖点,是提炼产品卖点的第二种方法。以一盆滤值类植物为例,它可以被放置在办公室、走廊、家庭、酒店大堂等多种场景,每个场景对应的目标人群完全不同——办公室采购关注公司形象,家庭买家关心装修风格,酒店采购则看重批量采购成本。

因此,一张主图无法覆盖所有目标人群,需要通过 BI 系统把场景需求全部抓取出来。数据显示,该店铺 75% 的搜索词都与场景相关,包括客厅、卧室、办公室、吧台、阳台、乔迁客户、公司直播间、大门口等十余种细分场景。每个场景对应一类买家,每个买家对应一种卖点,卖点的提炼必须基于场景细分。

提示词样例:"生成适合图中牵掌养植物的玄关环境",简短的描述即可衍生出无数个玄关场景。玄关之外,还有室外别墅庭院、别墅大门口(放两盆左右)、办公室、酒店大堂等多种延伸场景。把场景铺开,卖点的差异化自然显现。

6.3 AI 随机性与风格固化方法

AI 在生成内容时具有随机性(也叫多样性),这种特性在创意类画面中是优势。画面类内容追求多样,生成越多样越能找到优秀素材;而事实类内容(如"英法比分 6 比 4″、"π = 3.14″)则不能随机,必须保持精确。理解这一区分,是写好提示词的前提。

若想降低画面的随机性,可采用风格固化的方法。先用 AI 生成四张图,根据点击数据判断哪两张风格不行、哪两张风格可以,把可以的两张图作为参考风格,再加上风格提示词(如"深层什么什么风格"、"玄关的高天")继续生成。这样就能逐步把风格收敛到数据验证有效的方向上。

行业顶点的图片不是一次性生成的,而是边做边测、边测边迭代出来的。把四张图分成两组测试,撤掉数据差的两组,保留数据好的两组继续衍生,沿着数据好的角度反复进化,就能做出超出同行、甚至超出行业 1.5 倍到 2 倍高点的主图。

AI 随机性应对框架: 画面类(创意) → 利用随机性,批量生成,多中选优 事实类(数据) → 禁用随机性,确保答案唯一 风格收敛法 → 测图筛选 → 保留优风格 → 加风格词再生成

6.4 五金装清洁剂的 B 端市场细分定位

加克美旗舰店主营家庭清洁,所在类目竞争异常激烈——微博先生、水卫仕等大品牌林立。在如此内卷的市场中,加克美从 2023 年起用了大约一年半时间,销售额实现三倍增长,关键在于切入了一个细分赛道:五金装清洁剂。

五金装清洁剂是大桶装浓缩清洁剂,使用时需要兑水稀释,一桶可以用十年。这类产品的目标客户并非普通家庭,而是酒店、保洁公司、开荒保洁等 B 端用户。B 端用户追求批量采购成本低、兑水使用效率高,与 C 端家庭用户追求便捷(一喷即用)的诉求完全不同。

时间节点叶子链接数总链接数销售额(万元)
2023 年 6 月1843180
2023 年 12 月43151325
2025 年73327719

6.5 有效链接数与销售额公式升级

电商销售额的传统公式是:销售额 = 展现量 × 点击率 × 转化率 × 客单价。这只是单链接的销售公式,无法解释多链接运营的规模效应。在 AI 时代,需要把它升级为:销售额 = 有效链接数量 × 单链接平均销售额。

有效链接数指能够进入行业前 300 且产生真实销售额的链接,无效链接(没有销售、没有权重)即使再多也无意义。加克美从 2023 年 6 月的 43 个链接(销售额 180 万),到 2023 年 12 月的 151 个链接(销售额 325 万),再到 2025 年的 327 个链接(销售额 719 万),销售额翻了近三倍,核心驱动力就是有效链接数的倍增。

销售额公式升级:

  • 传统:销售额 = 展现量 × 点击率 × 转化率 × 客单价
  • 升级:销售额 = 有效链接数量 × 单链接平均销售额

加克美案例: 18 个叶子 → 43 个 → 73 个 43 个链接 → 151 个 → 327 个 180 万销售额 → 325 万 → 719 万

6.6 包装品控与买家秀的真实差异化

加克美的搜索结果页面展示了大量不同使用场景的产品图:有做加盟拨的、有做牛油的、有做除油的、有做除胶的、有拖地的、有浴室除水垢的;材质上也分石砖、亚光、地板实用、宇宏服蓬松、大油擦玻璃等。瓶子颜色、功能、使用场景各不相同,但里面的液汁本质同源。

这种"同源多 SKU"的策略,本质上是靠包装品控和买家秀构建真实差异化。每个 SKU 都要单独的瓶子设计、单独的包装、单独的卖点文案——在过去这意味着大量美工工作量,一个链接要做好几年,一年出几百个链接非常辛苦。

AI 把这种工作的速度提升了一倍:以前生成一个链接需要两周,现在一周就能完成。如果用这种速度去覆盖更多细分场景,生成更多有效链接,增长速度会比过去快得多。包装品控的差异化不再是大品牌的专利,中小卖家也能靠 AI 快速复制多场景多 SKU 的打法。

第七章 图生图工作流与模特道具复用

7.1 参考图驱动与精确表达

给到 AI 的每一个字、每一张图都会引导结果向指定方向生成。

把图中绿色改成黄色,同时生成一个冰箱内部专用清洁器的包装效果图,这类提示词中即使有错别字,也不会显著影响生成结果,因为参考图本身的引导作用远大于文字细节描述。

除非有明确的卖点要求需要 AI 重新生成,否则大部分情况下,AI 会先生成图,满意则无需额外文字指令。精确表达需求的关键在于明确告知 AI 想要生成的图片类型——长镜图、模特图、前后对比使用效果图、平面设计图还是包装贴纸图,框架写清楚才能得到预期结果。

只有把图片类型、产品定位、生成用途写成一个可执行的标准化框架,才能避免每次生成过于个性化、无法稳定复现的问题。

当标准框架确立后,从这个图到那个图的迁移才有迹可循,例如从印象内部专用清洁器迁移到玫瑰花向异色清洁器、浴缸清洁器的包装效果图与贴纸平面图,提示词结构均可复用同一模板。

7.2 配色变体与电商主图生成

在确认第一张图效果满意后,可通过修改配色与产品名称批量生成第二张图,例如把图中的绿色改成蓝色,生成橘子化向强烈清洁器的多个效果;再生成橘子化向强烈清洁器的平面贴纸、玫瑰花向异色清洁器的贴纸平面图、浴缸清洁器的包装效果图与贴纸平面贴纸。批量变体的提示词结构高度一致,只需替换产品名与颜色描述即可。

当贴纸平面图与包装效果图都生成完毕后,就可以生成电商主图。生成电商主图时,可附加促销信息与营销文案指令,例如买二送一、限时折扣等,AI 会自动将文案排版到主图上。如果希望文案更精确,可直接在提示词中写明"生成促销信息:百二送一"等具体内容。最终生成的电商营销主图带文案的成品,可以在淘宝销量排序的竞品页面中替换模拟测试。

7.3 模型代差与测图方法

不同模型之间的能力差异极为显著。

以电商主图生成为例,Pro 模型与 GPG 的 Image 2 模型在 2025 年 10 月到 2026 年 4 月这半年间发布,两个季度的时间差导致画面精细度产生肉眼可见的代差。

Image 2 模型生成的电商主图在光影、产品质感、场景氛围上明显优于早期 Pro 模型,与淘宝销量榜前几名的行业图几乎无差别。

测图时,可使用达比在淘宝搜索"浴缸清洁器"并按销量排序,将自己生成的图片复制到竞品图中进行视觉盲测。如果盲测时多数小伙伴都倾向于点击 AI 生成的图而非行业现有图,说明新图具备竞争力;反之则需继续迭代。测试时可使用白底图与牛皮纸风格图做 A/B 对比,通过数据而非直觉决定使用哪一张。

需要警惕的是,部分企业虽有美工甚至设计总监,但常因感性判断要求微调角度,这种经验主义操作既耗时又无数据支撑,应避免被此类意见带偏方向。

7.4 流量逻辑与主图数量策略

淘宝搜索算法的展现量并非完全由付费推广驱动,而更多由内容供给与对手供给决定。在只有一条链接的情况下,只能获得一波展现机会;如果有十条、一百条甚至更多链接,展现机会则呈数量级增长。以前不敢想象做一千个主图,因为传统模式下单个主图成本约 2500 元,一千张就是天文数字;而现在单个主图成本已跌至 5-10 元,一个品做一百个主图已成为竞争标配而非成本负担。

一个品有一百个主图,对手只有两个,在同样的优化动作下,曝光与点击的差距会被无限放大。这种"主图数量碾压"是中小卖家构建竞争壁垒的核心路径——同样比你多、比你好、比你会测试,就是在用单位时间迭代次数换点击率上限。

7.5 关键词筛选与场景化主图衍生

以植物营养液为例,通过下载类目关键词表,可以筛选出与植物相关的细分词,例如发财树、富贵竹、兰花、三角梅、盆栽、蝴蝶兰、帝锣、韭菜、莫莲花、月切花等。把这些与品类相关的关键词复制到 AI 对话框,要求"将下列关键词跟植物有关的全部齐取出来,并用表格进行展示",即可快速获得结构化的细分场景列表。

接下来可以用"富贵竹专用营养液"、"发财树专用营养液"、"植物营养液通用型"、"花卉营养液"等长尾词逐一生成对应场景的主图。搜索"富贵竹专用营养液"的用户看到的应是一盆富贵竹的画面,搜索"养南竹专用"的应出现南竹场景,搜索"花卉营养液"的应出现乐器花开得很好的画面。关键词越细分,主图与用户搜索意图的匹配度越高,点击概率随之提升。

关键词类型示例衍生主图场景
品类通用词植物营养液通用型通用型绿植场景
单品专用词发财树营养液、富贵竹专用单品盆栽特写
长尾场景词花卉营养液乐器开花场景

对于没有专业系统的中小卖家,可直接在生意参谋里下载关键词全表,粘贴到 AI 助手的对话框中即可完成同样筛选。语音输入法是降低提示词撰写门槛的关键工具——想到什么直接说给 AI 听,少一次手写转化的环节,能让真实想法更丰富、更准确地被 AI 理解,从而保证主图与意图的还原度。

第八章 电商详情页AI规划与素材对标

8.1 语音输入降低打字损耗

拼音打字过程中频繁的思考与转化动作会让提示词的诉求被中途打断,需求往往写得不够强、也不够确定。装一个语音输入工具直接讲出来,绕过中间转化环节,可显著降低从想法到完整提示词之间的程序损耗。与文字输入相比,语音输出的需求强度更足、表达更完整,避免了"差不多得了"、"赶紧发给他"这类潦草应付。

需要先在脑中过一下完整诉求,把要做什么、要输出什么格式、要在哪里展示一次性说清,再按下语音键。语音流的关键不是速度快,而是表达完整,把"将下列跟食物有关的关键词全部提取出来并用表格进行展示"这类包含格式要求的完整需求一次性讲到位,避免反复补全造成的指令碎片化。

8.2 关键词提取与品类深度拆解

用 AI 模型对产品类目做关键词提取是详情页规划的第一步。把"跟植物有关的词根全部提取出来,并用表格进行展示"这条指令丢给 PBP3、Qwen 等模型,会自动按肥料类型、适用植物、功效功能、剂型形态、品牌等维度展开。这一步的核心价值在于,把一个营养液品类的全部边界一次性铺开,避免遗漏蛋肥、颗粒肥等其他肥料形态,也避免遗漏发财树、富贵竹、绿萝、兰花、文竹、君子兰、杜鹃、玫瑰、桂花、多肉等几十种目标植物。

光是一个营养液品类无法吃透全部市场,因为类目下还有各种肥料、蛋肥等分支,产品线必须铺得很长才能覆盖需求。从供能相关的功效维度看,生根、壮苗、促花、催果每个方向都能撑起一个子品类;从形态维度看,有液体也有颗粒,差异同样显著。品牌侧虽然真正活跃的就那么几家,但把全部关键词铺开之后,品类布局的颗粒度、菜单长度、产品线深度就一目了然。

8.3 找瓶子先测款降低启动风险

品类关键词全部梳理清楚之后,接下来要做的不是立刻开发产品,而是先找一个瓶子。即便产品本身还没有搞出来,先用一个造型还不错的外购瓶子做主图上架,跑主策点击转化数据。这一步测试的是产品概念方向对不对,以及背后是否有真实需求。

如果客服那边已经有人主动问"能不能买",就证明视觉方向是有需求的;如果主策的点击转化跑得不错,那就说明产品方向成立,可以再推进后续的实际研发工作。这样做可以把创业失败的风险前置消化掉,用最少的成本验证产品概念,再用数据驱动决定是否投入完整资源做产品、打磨包装、布局供应链。

8.4 提示词模板化与制度化批量生产

核心提示词模板必须做到只改关键变量、其他一律不动。植物营养液详情页的模板是"保持瓶子造型不变,给[植物名]生成一个新的包装方案,植物是[植物名],品牌是大饼"。从君子兰、文竹、杜鹃、玫瑰、桂花、土豆、绿萝到十几种植物,只需要把植物名称替换一下,剩下的就是光光的标准化生成动作。

包装盒子、平面贴纸同样适用模板化思路。指令是"生成图中瓶贴平面图,保持内容和构图,平面图排一比一构图",然后把植物名称换成文竹、杜鹃花,产品贴纸就批量出来了。同样的思路可以延伸到外包装盒子——"为生成图中瓶子设计一个包装盒",牛皮色盒子配绿色包装对应文竹,粉色盒子对应杜鹃花,把刀版图交给工厂就能直接落地。

把核心提示词模板化、把替换动作制度化之后,事情就可以交给公司里的财务、文员批量执行,核心人员只需要把模板定好、判断图片点击率与转化率是否达标,剩下的就变成可以批量化、可以制度化复用的流水线。这一步是 AI 自动化的关键,只有做到不需每次都重新构思,才能真正跑通批量生产路径。

8.5 效果证明与场景广告图批量测款

卖功能功效型产品必须有效果证明图。围绕"用了我的植物营养液,你的杜鹃花已经长得那么好"这一逻辑,先生成一张杜鹃花摆放在阳台上的场景图,再生成一张文竹放置在五颜六色花盆里的场景图,然后用左右构图把场景图和产品图拼成一张广告图。左图是使用效果场景,右图是产品本体,直观证明功能价值。

这种效果证明图不能只做一张,要多铺几条链接、多跑几次测款,看哪一张的点击率更高、转化更好。素材量上去之后,链接整体数据自然会被拉起来。同样可以批量生成君子兰种植场景图、君子兰电商组图等变体,全部投入行业里测款,跑出胜出素材再大规模投放。

8.6 功能细化与文案卖点提炼

从关键词表格出发,可以根据需求做更细的卖点提炼:杜鹃花瓷纹养叶有专门配方,君子兰、松土、促花、催果、灼伤修复、储存等每个动作都能对应一款产品。把全部需求列出来之后,文案撰写会更清晰——"我卖的是松土、促花功能,产品麦里就是这样",一句话就能讲清楚产品价值。

这种细颗粒度的卖点提炼最终落到产品包装文案上,比如"南竹植物专用营养液,就你们家有,纸做得最好,品价最好,买家秀做得最好看,不买你买谁"。要解决的不是产品能不能用的问题,而是"为什么买你不买他"的问题。差异化卖点、品牌调性、买家秀三个维度一起做,才能把通用型产品做出专属感。

8.7 模特复用解决童装童模过时问题

童装行业长期被童模年龄增长带走的痛点困扰。曾经特别好的小孩过了几年就穿不下衣服,可爱感消失,买家对店主审美也会失去信任,业绩逐步下滑。AI 时代不再需要真实童模,通过生成摩卡(模特卡)锁定人物一致性,就可以让虚拟童模穿遍店铺全部款式,解决"这小孩长大了他也不穿不了人家衣服了"的核心痛点。

摩卡生成的关键是面部特征和体型的一致性保持。先用一张生成的"两岁亚洲大眼睛可爱小女孩"基础图,再去生一个详细摩卡——包含面部各种角度特写、全身各式图,中文描述即可。摩卡锁定后,叠加产品版型图交给 AI 生成系列图,模特就永远是两岁大眼睛的可爱形象,产品开发能力因此被极大拓宽。

8.8 多图拼接与低成本批量出图

2×4 宫格图、3×2 宫格图是批量生成的核心载体。指令格式是"图一的模特从图二的人群里戴着草帽,摆出俏皮姿势展示裙子,生成二乘四的宫格图",用全能模型 Pro 一次性能生八张 4800 像素宽度的拼图。平均下来每张宽度有六七百像素,对日常使用已经足够;若觉得不够,可以选 4K 模型或生 3×2 宫格(每张宽度达 1000 多像素),再点空格键放大、点切割线分四张,七八张成品图就出来了。

成本结构看,八张图拼起来大概一块多钱,平均每张一两毛钱,几乎不需要算力。这种低成本让多铺测款素材成为常态——同样的模特、同样的产品,改一句"头发扎成小辫子",就能换一组姿势与造型,八张图的批量生成完全跑得通。变体可以无限延伸:戴草帽、不戴草帽、小辫子造型、运动风造型,每一组都对应一条测款链接,数据驱动的素材筛选就有了足够大的样本池。

第九章 参考图复刻与画面比例控制

9.1 模特生成与道具复用工作流

固定女性模特:通过先裁脸再生成的路径产出模卡,模卡包含各种不同的角落与面向,作为后续所有动作生成的素材源。模特生成完成后,直接拿到相对应的照片(常见姿势参考)生成同一位女性模特的不同动作,本质上是把模特"接上去",在不同场景中循环复用同一个人物形象。

瑜伽场景的处理是典型的工具绕过案例:瑜伽动作本身难以用文字精准描述,与其死磕描述几个礼拜,不如用"我人已经有了,让他做出来这样的动作"的逻辑——画面感觉是否完美不重要,关键在于呈现核心动作。动作生成完成后,固定模特的穿搭环节采用"所有道具都拿过来,十种部分都穿搭"的策略,让 AI 把所有道具与已有模特结合,得到一系列服饰搭配变体。

穿搭变体还需要进一步组装:将单张穿搭图与已经合成好的姿势图结合,让 AI 重新生图,搭配上不同的发饰、包包、鞋子,产出同一件衣服的多组变体。一组做完换另一组,不同衣服、不同穿搭,持续往复。整套画布一个人就可以干完,过程不再赘述,核心是把"模特—姿势—穿搭—配件"四类素材解耦后再循环拼接。

9.2 参考图驱动的组图方法

组图的核心逻辑是"图一生成图二,生一组图",再从一组图延伸出更多组。提示词模板为"延续图一的风格,展示图二的调整,生成二乘四的风格图",或"延续什么什么风格,参考什么风格,为图二生成一个什么图"。参考图的来源可以是自己的图片、网上找的图片、之前 AI 生成的图,也可以是竞品的图,总之要给一张参考图让 AI 延续。

实操中通常先用"延续图一的风格,展示图二的调整,甚至二乘四的功格图,分别据选 4K,画的顶级选 16:9,模型选图,然后移情出发"的提示词,选 4K 面具、16:9 面具生成一张极其大的图,单次就能生八张。AI 不会每次都生一模一样,会在内部加工分发,所以八张里往往有差异,可以从八张里挑满意的留下,不满意的去掉,如果八张不够就再生成一次得到十六张,加上排版文字即可成组。一次出图的数量可累积达 1000 多张,完全覆盖放主图、放那边的需求。

另一种方法是直接裁切输出:拿到一张超大图后,在画面上选择二乘八、二乘三、四乘四、四乘二等多种多风格图的比例,让参考图的变化性往里送图,然后裁切得到消费级素材。28 兆到 30 兆的 4K 图裁成八张后,每张图可用性依然非常高,信息度性比也非常好。如果觉得还不够清晰,把裁切出来的图再让 AI 重新生成一张 4K 图,就能得到极其夸张的清晰度。

9.3 画面比例与画面比控制

画面比例的调整通过修改画面比例参数实现,既可以改成 1P 的,也可以改成 2P 的,或者直接改成 16:9。具体操作中,16:9 在参数里写"16p9″,如果改成 13:3、3:4 则在参数里写对应值。3:4 的图像指数约为 1700 像素,差不多 1800 乘以 2400 这个比例,4:3 则更大,所以画面比例调整后的清晰度直接受比例与像素参数影响。

画面比例的"自动去掉路边"功能是裁切流程的延伸:以某条路边生成一张高清图后,可以直接把路边去掉,或同样体验时直接往下给视频去掉,再让 AI 重新生一张,比单次生成一张非常高清的路边效果更好。这种"路边高清化"的操作本质上是用 AI 修正裁切边界,而不是依赖一次性生成。

裁剪路径有两条:工具裁剪与手工截图裁剪。在工具裁剪路径中,选中大图后选择"切割四个图,确认切割",工具会自动弹出分割结果,四个分区立刻可用。白色边缘等小瑕疵可以不用管,如果需要再加工就清掉,重新调整即可。手工路径则直接对生成的大图执行裁切,得到消费级素材。无论哪条路径,裁剪精度都不必严苛,AI 会自行修正边缘与比例适配。

9.4 模特服饰与场景细节

服装生成必须区分"模特已有的图"与"原本的图":原本是单张平铺的衣服,经过模仿姿势合成后,出来的是一组织图,再结合上面的穿搭、图件配置、装饰等元素,让 AI 重新生成系列变体。搭配逻辑是"配上不同的发饰、配上不同的装饰、配上不同的包包、配上不同的鞋子",得到多个变体,但衣服还是同一套衣服,核心是同一衣服多组变体,仅换姿势与背景。

瑜伽谷作为场景参考可以自行生八个或十个不同的人物,这些人都能穿同一套瑜伽服,本质上还是参考一个面试或另一个动作模特,通过模特拼接实现"移花接木"的效果,生成的图跟参考来源一点关系没有,是 AI 在身体之间做转型。过程中"有些死保定,有些是参考人的知识",但最终输出的人物已经完全是新生成的。

产品素材的清晰度要求因类目而异。地毯这类材质类产品必须把细腻的材质纹理拍清楚。地毯本身没什么角度,或者角度可能也比较少,这是它的特性。桌子这类场景类素材则需要一张超大图配合四个不同的风格:延续图一的风格,展示图二编辑,可以添加图幕,生成二乘四的风格图,AI 会在里面添加图幕展示不同的样子。

9.5 包包详情页的参考图复刻

包包详情页的复刻流程展示了一组参考图如何衍生多组变体。一组包包生成后,另起一组时可以这样写提示词:"生成图一产品,短途旅行报",结合妈咪包带孩子出行、放孩子用品等场景,也可以是短途旅行的使用场景。具体场景可以根据产品客群来定:可以是妈咪包的用途,也可以是短途的旅行报,模特儿飞者展示,核心是理解产品的使用场景并把它写清楚。

风格统一上,画面依旧是二乘六,两行六列,尺寸统一的十二风格组,4K 分辨率十六比九,选最大分辨率,选十六比九版,用五项二的模型生成,得到十二个风格一致的图,里面全是不一样的模特儿、不一样的风格,但同样的产品(或者不同的产品)。这种"同款多模特"的输出可以再裁剪出来继续往下延展。

鞋子作为类目延伸,生成逻辑类似但有特定约束。简单鞋款不复杂,不是那种造型很夸张的造型很复杂的鞋子;类似跑步鞋、运动鞋这类鞋款,描述要包含前后左右、底部、中部等角度,但要注意"要把鞋放后面长得一样"——多给鞋、要讲究左右对称,不然 AI 就会生错或者产生心理性偏差。

提示词模板可写为:"生成图一产品,淘宝电商营销成绩页,手评喊报,五平样头,十张红套,穿一些展示服,材质和细节头,18 秒"。画面两行六列或二十二、二十六都行,如果选二十五就是十公格图,统一尺寸的十二公格图。同时要明确:"第一品是海报处有,二到六品是模特上角展示处,没有红南,卖点图有文字,匹配配产品颜色,就是背景色匹配产品颜色,产品颜色都红到背景色,保持图一细节图,保持协定红南,南红南三条浪"。

9.6 鞋子变体与买家秀延伸

鞋子的买家秀延伸逻辑是"一次一身十二张,做买家秀,拿小红书出的重套笔迹"。模特展示图需要拆分为"生成压正模式上脚展示服,背景为小书,网拍揭拍风格"这种明确指令,因为是卖鞋子的,需要的角度是穿上去的特性图,可能有全身、半身、局部特写等不同景别。宝宝鞋子出发的角度也是类似,左右边必须给清楚,别偷懒不给清楚,不然 AI 伸出来的鞋子左右长得一样,就没法做差异化。

变体生成路径有两种叠加方式:一是继续在同一个母图上做"进一步延展、进一步推进",产出展示厨、生娘组等不同画面;二是把生成的素材拿去当买家秀,或者送给外部渠道使用。这些衍生素材再输入 AI 做新一轮生成,形成"参考图—生成图—买家秀—新一轮参考图"的闭环。养生虎、球衣等服装类目也是同样的工作流,本来工费就低一点,等着等着就能跑通。

电商详情页的另一种输出是直接按"亚洲男性足球院,上升再生"这类场景指令生图,画面可能有全身、半身、气球时等不同景别。接近的图直接去掉一张,保留比较真实的、有点像实际赛场感觉的图。最终的图代表了一个相对完整的"场景—人物—服装"组合,可以作为主图或详情页头图使用。

9.7 参考图复刻的第二种方法(GPG2 直出)

第二种方法使用 GPG2 模型,直接初详是第一,不需要参考图,只要给张白领图(白底图)就行。白底图本身宽度可能不够,所以要给宽一点,接下来写提示词时要把输入要求对外讲清楚,这是和图罗模型不一样的方法。

以淘宝电商详情页为例,提示词模板为:"生成图一产品,玛丽邦的淘宝电商详情页,手评喊报有文字,母型妈衣带包包图,带包包图型的展示图没有文字,然后材质图有文字,包包细节图有文字,多文字,这类有文字,面图,画面二层六,二行六列尺寸,你的十二公图图就二行六列尺寸,十二公图图,那么依然是四 K 分辨率,十六和九,选最大分辨率,选十六和九版,然后用五项二的模型深圳,把你的需求写得再详细点"。

这时候 AI 就会给一生十二公图。有些人会说生完之后有一些地方有字有一些地方没有字,解决办法是写稍微具象一点,比如"第一章到第五章是什么呢,是使用长颖竹线,然后不能有文字,那么后面什么呢,后面有细节图有文字,然后这个多广多是个图有文字,那么就会得到这样的图有文字"。整个提示词非常简单直白,几行字就能让 AI 一次生成十二张统一尺寸的详情页图。

后续优化要结合市场分析、对手评价、卖点分析等前置策划。策划完了之后再给 AI,它的脉领会变得更加聚焦。第一组生成后,再来另外一组,比如"生成图一产品,短途旅行报",通过多组并发生成覆盖妈咪包、短途旅行、模特儿飞者展示等多种场景,核心是对产品客群的精确理解。

9.8 画布总结与全工作流复盘

整套画布的工作流可以总结为以下三步,每一步的产出与下一步的输入清晰对应:

步骤输入工具/模型输出关键参数
第一步模特原图(裁脸后)图罗模型固定女性模特模卡多角度、多面向
第二步模特模卡 + 道具图GPG2 / 图罗穿搭变体系列16:9、4K、二乘四
第三步穿搭变体 + 姿势参考图GPG2 / 图罗详情页十二宫格二行六列、十二公图

第一步走"图一生图二"循环,产出模特;第二步用 GPG2 模型直出穿搭系列;第三步回到图罗模型把穿搭和姿势合成为最终详情页。三步之间的衔接点是模特图、道具图、姿势图三类参考素材的复用。

全工作流覆盖了三种典型场景:瑜伽场景绕过文字描述难题、固定女性模特循环复用、瑜伽谷自生人物搭配穿衣。每一类场景都遵循"参考图驱动 + 裁切复用 + 多组并行"的逻辑,核心思想是把单张素材的价值最大化,通过 AI 的随机性对冲保证产能,通过参考图的精确性保证风格统一。最终单个画布一个人可以完成所有出图工作,效率与产出都显著高于传统流程。

第十章 总结与行动建议

10.1 全文要点回顾

  • 第一章 核心提示词与一图胜千言方法论:用"淘宝电商主图"六字提示词一次生成三组变体配合五个"不变"附加指令实现一比一复刻,把迭代速度作为点击率上限的真护城河。
  • 第二章 AI红利与岗位重塑:AI 把能力平权与参考图红利送给小卖家,2-3 人小团队即可撑起几千万销售,江西小县城案例证明组织瓶颈可以被 AI 直接绕过。
  • 第三章 批量生成与参考图工作流:用海马体职业照替代、穿搭俄罗斯套娃式迭代、候选法取代决策法把单位时间迭代次数推到 100 多张/周。
  • 第四章 精准表达与提示词设计原则:多生几张对冲随机性、用参考物替代尺寸、把四张单图拼成一张组合图、先想清楚需求类型再下笔、分步生成避免一步到位偏差。
  • 第五章 成材率评估与数据驱动测图:成材率 ≥ 50% 是工作流健康阈值,真实成本公式为"单张费用 ÷ 成材率",测图配合废片反哺形成提示词优化闭环。
  • 第六章 跨类目参考与差异化卖点提炼:跨类目借图只取排版骨架、用场景需求驱动卖点、风格收敛法收敛随机性,加克美从 43 个链接做到 327 个链接、180 万做到 719 万。
  • 第七章 图生图工作流与模特道具复用:配色变体批量生成电商主图、模型代差决定画面精细度、用关键词表驱动场景化主图衍生,主图数量碾压构建竞争壁垒。
  • 第八章 电商详情页AI规划与素材对标:语音输入降低打字损耗、关键词全表做品类深度拆解、找瓶子先测款前置消化风险、提示词模板化做到财务文员也能执行。
  • 第九章 参考图复刻与画面比例控制:模特—姿势—穿搭—配件四类素材解耦循环拼接、GPG2 直出十二宫格详情页、单人画布即可完成全部出图工作。

10.2 可执行行动清单

阶段关键动作量化指标
出图规范用"淘宝电商主图"六字提示词 + 五个"不变"附加指令生成三组变体一次出 3 张,直接进直通车,每组预算 1 万元
出图规范先按模型固化尺寸生成(1024/2048/2880、1152×1536 等),再裁切缩放到 800×800 或 750 宽度平台合规率 100%
提示词设计多生几张对冲随机性,目标成材率 5 张出 4 张成材率 ≥ 75%
提示词设计把同款多规格产品的 4 张图拼成 1 张组合图再喂给 AIAI 理解偏差次数从 4 次降到 1 次
迭代速度把单位时间迭代次数从 1 张/周提升到 30 张/天7 天内跑出 100+ 张候选主图
迭代速度用候选法取代讨论法,数据决定主图去留单周测图 ≥ 100 张,点击率 ≥ 类目均值 1.2 倍
工作流评估用"单张费用 ÷ 成材率"反推真实成本,目标 ≤ 2 元/张成材率 ≥ 50%,单张真实成本 ≤ 1.67 元
工作流评估测图淘汰的废片每周反哺提示词模板每周复盘 ≥ 1 次
跨类目参考跨类目借图只取排版骨架,替换产品与文案二次迭代几分钟内出一版新素材
跨类目参考BI 抓取场景细分词,75% 搜索词铺场景化主图场景词覆盖 ≥ 10 个
销售公式升级从"展现量 × 点击率 × 转化率 × 客单价"升级为"有效链接数 × 单链接销售额"有效链接数从 43 增至 327,销售额从 180 万增至 719 万
B 端细分跳出 C 端红海切入五金装清洁剂等 B 端赛道,一年半做到 3 倍增长链接数 43→151→327,销售额 180→325→719 万
主图数量碾压单品做 100 个主图,对手 2 个主图单品主图 ≥ 100 张,搜索展现量数量级增长
关键词衍生下载生意参谋关键词表,按发财树、富贵竹、兰花等单品词逐一生成场景主图长尾词覆盖 50+ 个
详情页规划语音输入 + 关键词全表拆解品类,做到营养液菜单全部边界铺开一次铺开品类下全部关键词维度
风险前置找瓶子先测款,客服有人主动问再启动研发主策点击转化跑通后再投入完整资源
模板化批量化核心提示词模板只改植物名等关键变量,其他一律不动财务/文员可独立执行日均 50+ 张出图
模特复用生成 2 岁亚洲大眼睛小女孩摩卡锁定人物一致性,童装全款式复用虚拟童模贯穿店铺全部款式
多图拼接用二乘四、二乘六宫格一次生 8-12 张,4K 拼图裁切成消费级素材八张拼图 ≈ 1 元,单张 1-2 毛钱
模特四要素解耦把模特—姿势—穿搭—配件四类素材解耦后循环拼接单人画布完成全部出图
详情页批量生成GPG2 直出十二宫格详情页,二行六列、4K、16:9一次生 12 张统一尺寸详情页图

10.3 决策流程图

  1. 因为 AI 出图随机性高、单张成材率常低于 25%,所以 必须采用"多生几张"策略把成材率推到 ≥ 75%,用"5 张出 4 张"标准替代纠结单张成本。
  2. 因为 出图成本由"单张费用 ÷ 成材率"决定,三毛钱一张乘以 30% 成材率实际成本高达 1 元以上,所以 选模型时优先看成材率而非单张报价,把真实单张成本压到 ≤ 1.67 元。
  3. 因为 讨论方案的方向选择常被感性判断主导、经验反而成为包袱,所以 用候选法取代决策法,通过 100-200 元预算、3-5 天直通车测图,让点击率数据决定每张图去留。
  4. 因为 单位时间内的迭代次数直接决定点击率上限(三个月做三张图与一上午迭代 100 多张图相比,后者成功概率高几个量级),所以 必须把迭代速度作为护城河,做到单品 100 个主图、单周 100+ 张候选。
  5. 因为 AI 模型对参考图的理解远胜于对文字描述的理解,一张刁钻角度的产品图会让 AI 理解偏掉,所以 必须用最佳角度的白底参考图喂给 AI,跨类目借图只取排版骨架而非复制内容。
  6. 因为 多张同款不同规格产品分开传图会让 AI 每次理解都产生偏差,所以 把四张单图拼成一张组合图,提示词中明确"图中是四个柜子、每个单元尺寸一样",让 AI 一次理解整体约束。
  7. 因为 单条链接的展现量受内容供给与对手供给决定,链接越多展现机会呈数量级增长,所以 把销售公式从"展现量 × 点击率 × 转化率 × 客单价"升级为"有效链接数 × 单链接销售额",靠有效链接倍增驱动规模增长。
阅读量: 293