左:香蕉长 Prompt,注释里保存的完整版本共 1311 个字符;右:风格+画面描述,完整版本共 563 个字符。
这不是一组「长 Prompt 失败、短 Prompt 成功」的对比。
两张图片的效果其实都很好。
长版很准确地执行了「枫叶大幅虚化、人脸是唯一清晰焦点、另一只手贴在锁骨、暖金斑驳光掠过五官」这些要求。
但为了得到这几个关系,它从人物、动作、构图、镜头、光线一路写到优先级清单和二十多条避免事项,同一个重点被重复提醒了好几遍。
反看短版,我没有把信息拆成十几个栏目,而是采用了风格词➕关键词的叠加。
它直接描述眼前能看见的画面:右侧裁切的人脸、闭合的眼睛、近镜头枫叶、贴近锁骨的手、马海毛纤维和穿过叶隙的暖金光。
结果里,光带更自然地贴在脸上,枫叶、人物和光线也更像发生在同一瞬间。
也就是说,同样一个画面,你完全可以用很少的提示词生成一样甚至更好的效果!既然如此,为什么还要费劲巴拉地写那么长的提示词呢?!
或者你有没有想过,image-2 有时候生成图片碎,可能就是因为你的提示词太多了,几组词相互打架你却检查不出来!这才是解决 image-2 碎图问题最容易被忽略的根因。
所以:
换到 GPT-image-2 之后,最先要升级的可能不是你的提示词,而是你对提示词的固有认知。
香蕉提示词真正留下来的,是一种写作惯性
如果你是从香蕉提示词玩生图玩下来的老玩家,那么你一定知道
以前用 Nano Banana 的时候,提示词写得长、写得细、写得像一份结构完整的视觉需求文档,确实更容易把任务交代清楚。
于是大家慢慢练出了一套固定动作:
主体、场景、镜头、构图、光线、材质、色彩、质量词、负面词,一个都不能少。
最好再写成 JSON。
最好每个字段下面再补几条。
生怕少写一句,香蕉就不知道你想要什么。( 因为香蕉你不写,它真的就不给出啊!!! )
这套方法在香蕉身上没有错。
错的是模型都已经换成 image-2 了,我们还把这套写法当成生图提示词的唯一标准。
我翻遍了市面上现在八成的用户玩生图提示词,还是这样的,分享出来的提示词依旧是很长很长的一大段!
这其实就是: 模型换了,脑子没换 。
明明只是想要一张雨夜便利店人像,最后写出来的东西比真正拍一组写真还复杂。
更麻烦的是,你写得越多,越难发现里面到底有多少东西正在互相打架。
既要抓拍感,又要奢侈品广告感。
既要柔和空气感,又要强烈电影光。
既要胶片颗粒,又要 8K、锐利、极致细节。
这些词放进同一张图里,它们就开始抢方向、抢权重!
然后 image-2 只能一人分一点,最后给你拼出一张哪哪都对、但哪哪都差点意思的图。
这就是我说的碎,也是很多人吐槽为什么image-2 生成的图片画面那么碎!!!
不是图片真的裂开了。
是风格碎了,光线碎了,情绪碎了,主体也不知道自己到底该往哪个方向走。
所以 image-2 的生图提示词到底应该怎么写?
到了 image-2,先选风格,再说画面
我现在写 image-2,已经很少先打开一份大模板挨个填空了。
我会先找一个风格词,确定这张图到底应该长什么样。
然后再补画面里真实能看见的东西。
谁,在哪里,正在做什么。
光从哪里来,画面是什么颜色,最重要的东西应该落在哪里。
就这么简单。
所以我现在真正想积累的,已经不是一条又一条完整 Prompt 了。
而是把每次真正影响结果的风格词、光线词、构图词和材质词留下来。
用一组很简单的词来讲解一下吧:
「雨夜街头 editorial」「冷暖霓虹」「潮湿空气感」「旧纸印刷」「轻微金箔质感」,这些东西换一个人物、换一个商品、换一个场景,照样能继续用。
这才叫风格词库。
它不是把别人的整段 Prompt 搬回来收藏,而是把真正能控制画面的东西拆出来,慢慢变成你自己的视觉语言。
为了确认开头那组旧图不是偶然,我又重新做了两组对照。
这两组都没有参考图。同一个主题分别使用长、短两条 Prompt,每条只生成一次,也没有从一批图里挑最好看的。
先看雨夜便利店这组。