上个月帮一个卖香薰的朋友做主图,摄影师的报价和档期都排不开,我拿 Midjourney 先出了二十来版概念图给她挑方向。最后上架的图还是找人拍的,但拍摄方案照着 AI 图定的,沟通省了两轮。

它能干的是出创意方向、出场景氛围、出详情页配图,又快又便宜。真实材质和精确文案这两样先别指望,杯子釉面的反光、包装盒上的小字,现阶段做不出来。

Midjourney 的操作就三步:输入 /imagine,贴提示词,等四张缩略图。不满意就用 U1 到 U4 把某一张放大细化,或者用 V1 到 V4 在那一版附近再变四张。

这个 U/V 的用法比调参数重要得多。新手常犯的错是觉得图不对就整段重跑,其实在四张里挑最接近的那张做变化,才是收敛最快的路子。我一般跑两轮 U/V 就能定下方向。

提示词我按这个顺序写:主体加材质,再场景,再光线,再镜头,最后风格。举个能直接抄的:

「a matte white ceramic candle jar with wooden lid, on a light oak table, soft morning side light from left, shallow depth of field, warm minimal background, product photography, 85mm lens, high detail」

中文提示词它也认,但产品摄影这一类的词用英文明显更稳,我基本只写英文。光线是最能拉开差距的一项,soft window light 出柔光,rim light 出轮廓光,studio softbox 更接近棚拍,同一版提示词只换这一个词对比着看,差别一眼就能看出来。

这里有个手感问题:词堆太多反而坏事。超过四十个词以后,画面容易变成什么都沾一点,主体反而被稀释。我控制在十五到二十五个词,先跑一版看构图对不对,再慢慢补光和材质。

参数上,–ar 管画面比例,主图常用 1:1 或 4:5,详情页横图用 16:9。–stylize 管风格化强度,数值低一点更听你的话,数值高画面更有味道但也更容易跑偏。–v 跟的是模型版本。

想复现同一张图,可以在末尾加 –seed 固定随机种子,这样改别的词时画面基调不会整个跳掉。想排除画面里的东西就用 –no,比如「–no text, watermark」,能少掉很多乱入的假字。具体可用数值和当前版本以官网为准,别照抄别人去年的教程。

选图我有自己的标准:构图、主体形态、光线,三样里占两样满意才放大,只占一样就再做一轮变化。这么筛下来,二十来版里能挑出三张能用的,比凭感觉挑效率高不少。

想让一批图长得像同一个东西,得用图生图。挑一张形态最正的图,把它的链接作为参考图放在提示词前面,再让模型在附近变化,产品轮廓就稳住了。做「同一款产品换五个场景」时,这招能省掉一半废图。

它最让我头疼的是细节的随机性。瓶身上的 logo、标签文字基本是乱码,跑十次大概有一次碰巧像字。所以我现在出图干脆不放文字,直接留白,后期用设计软件排上去,比反复抽卡快得多。

还有个现实问题:AI 图当主图有风险,它展示的质感和实物对不上,买家收到货会觉得货不对板。拿它做预热素材、详情页氛围图、投放前的方向筛选都很合适,真正挂在商品第一张的位置,该拍还得拍。

图从 Midjourney 出来之后通常还得再加工一道才能上架。背景太杂的我用 remove.bg 把主体抠出来换个纯色底,几十秒搞定,比自己在软件里抠边缘顺手。要出一组风格统一的模特图或者场景图,我会去 LiblibAI 挑一个现成的风格模型套上跑,出来的调子更贴国内电商那一挂。

尺寸也得提前想清楚。主图多大、详情页通栏多宽,各个平台要求不一样,出图前照着后台给的规范把比例设好,别等到上传才发现要裁。具体数值以平台当时公布的为准。

更多图像工具见 AI 图像工具。

你手上的产品是哪种材质?如果是玻璃或者金属这类带反光的,我可以说说提示词里怎么用柔光箱和背景距离把高光压下去。