同样的提示词工程,为什么别人出的图更稳,问题出在描述顺序上
去年十一月初在杭州出差,晚上回酒店没事干
,拿midjourney想跑几张产品概念图。
我当时个人看法是自己提示词写得挺全乎,主体、材质、光线、氛围、镜头参数全给上了,结果跑出来七八张,张张不一样,有两张连主体都变形了哦。
隔壁房间同事也玩AI绘画,同一套词他出的图就稳得多,四张里能有三张半能用。
我当时就纳闷了,一样的提示词工程,怎么就差这么多。
后来我把自己写的词和他写的词摆一起对比,才发现问题根本不在词好不好,而在描述的先后顺序。
我是东一句西一句,想到什么加什么,先写了“赛博朋克风格”,中间插了个“蓝色调”,最后才说“一个机械手表放在大理石台面上”。
他是反过来的——先把主体和场景定死,再叠光线材质,最后补风格和氛围。
我自己试了大概四五次,把顺序调过来之后,出图的稳定性肉眼可见地涨了。
我现在固定用这套顺序,跑了差不多两个月,出片率从原来的三成提到七成左右。
第一步先写主体,越具体越好,别只写“一只猫”,要写“一只橘白相间的短毛猫趴在窗台上”。
第二步写场景和空间关系,比如“窗台是旧木头的,窗外是模糊的梧桐树影”。
第三步加光线和材质,“下午四点左右的侧逆光,猫毛边缘有轮廓光,木头表面有细微纹理”。
第四步才写风格和氛围,“胶片摄影感,柯达portra400色调,安静慵懒”。
最后一步加参数和负面词。
我拿同一个主体做了两组测试,一组是“一个搪瓷杯放在木桌上,暖光,复古风格,浅景深”,另一组把顺序倒过来“复古风格,浅景深,暖光,搪瓷杯放在木桌上”。
第一组跑了六张,五张主体都在画面正中间,杯子形状基本没跑。
第二组跑了六张,杯子出现在角落的有三张,还有一张干脆把杯子画成了花瓶(这个我真没想到)。
同样的词,就换了个前后顺序,废片率差了将近一倍。
AI绘画模型理解提示词不是同时看所有词,它是按token顺序逐个加权计算的,越靠前的词对画面的锚定作用越强。
前大概十来个点的提示词决定了画面里有什么东西,中间那部分决定了东西长什么样,最后那大概十来个点才轮得到风格和情绪。
你把“梦幻光影”放最前面,模型第一反应是往虚了画,主体还没定呢光效先糊上去了,出来主体自然飘。
这个逻辑跟写文章不一样,写文章可以先抒情再切入正题,AI绘画不行,它没有“耐心”等你铺垫。
还有一个容易忽略的点——长尾词的位置也会影响权重。
比如你想让画面偏冷调,不要只写“冷色调”,要把“冷色调”嵌到光线描述里,“冷白色的顶光打下来”,这样冷调才稳。
我试过单独把“冷色调”放最后,跑出来三张里有一张偏暖,模型可能把冷调理解成了后期滤镜,没在光照层面执行。
另外像“电影感”“高级感”这种大词,放越靠后越安全,放前面容易让画面变糊变暗,我拿“电影感”放开头跑过一组,六张里四张暗到看不清主体。
上面这套顺序我也是踩了坑才摸出来的。
有一次我图省事,把“极简风格”写在了最前面,后面跟主体,结果跑出来的图倒是极简了——主体几乎快没了,就剩个轮廓。
后来我学乖了,风格词永远放在描述清楚之后。
你要是刚开始调,不用记太多,就记住一条:先说什么东西,再说长什么样,最后说像什么感觉。
这三步走顺了,稳定性能涨一大截。
