本页目录
构图是语法,故事是语义:AI生图的双层视觉导演法(下)
学会如何去描述一个带场景的画面
页面准备好后会自动显示。
我们经常可能会刷到一张图,看到了第一眼觉得惊艳后转个头就忘记了,
问题不一定出在构图、光影或者审美上。
更常见的原因是:画面里该有的都有了,主体、场景、风格一样不缺,但是整体之间却没有关联,画面缺少了故事感。
构图负责安排信息怎么被看见,故事负责让这些信息元素产生关系。
这两层拆清楚了,这篇就接着往下走:
怎么把它们,同时写进一条提示词里?
在上一篇还留了个尾巴:我们习惯把孤独、不舍、命运感这种词,直接丢给模型让它去理解。
这篇就来解决这个翻译问题:怎么把心里那点感觉,翻译成模型真能画出来的东西。
动手之前,先讲清楚一个很多人会弄混的点。
你构思一张图片的思考顺序,和真正把想法写进提示词的时候,顺序可以完全不一样。
构思的时候,顺着我们个人的的直觉来就行。
真正往提示词里写的时候,我会把顺序重新排一次,因为要先把画面最容易坏掉的地方给锁住(个人见解)。
构思一张图,我一般先让画面在脑子里演一遍。
大概是什么场景?什么风格?谁在里面?发生了什么?人物怎么站?最后有哪些东西必须守住?
这个顺序其实没有必要固定。
你可能先想到雨天和旧房间,也可能先想到一个人回头的动作。这些都是人的思考发散性导致的
但真正写成提示词时,我一般会重新安排按照下面的顺序写:
这么写的顺序的原因是,模型和人一样,也有“近因效应”和“注意力衰减”——写在后面的内容被执行的概率会下降
所以要把一些硬约束放在前面:
人数、左右、谁拿什么、谁看哪里一旦错了,后面的光影和风格再漂亮,整张图也不成立。
所以一句话总结就是:
想的时候顺着人的直觉,写的时候顺着画面最容易坏掉的地方。
先写人数、位置、身份和核心动作。
这部分的词要写的短,快,不要长篇大论。
比如:
双人。
左边是一名年轻女机械师,穿蓝色工作服,半跪着,右手递出一把银色扳手。
右边是一名年长男司机,穿棕色外套,站着,左手伸过来接扳手。
“双人”是在锁人数。
“左边、右边”是在锁位置。
服装跟在身份后面,是为了避免人物属性串到一起。
“右手递、左手接”则把动作方向说清楚。
不要只写孤独、悲伤、不舍、命运感、诗意。
这些东西每个人的经历不同,文化不同,那么理解出来的东西也就不同,模型也是有一个偏向性的
所以写之前先问自己:如果不允许解释人物内心,我还能让镜头拍到什么?
可以从这几个方向找:
前者在讲感觉,后者在交代现场。
“高级构图”“电影构图”“画面有故事感”,这些词说了等于没说。
要告诉构图具体服务什么(人和环境之间的关系):
这时留白、景别和光线就不再只是为了好看,而是在安排读者的阅读顺序。
前面三步清楚之后,再加胶片感、纪实摄影、复古私宅、清晨侧光。
风格词当然有用,但它更像调味。
人物关系没写清楚时,“电影感、故事感、胶片感”叠得再多,也只会让一张关系错误的图变得更精致。
我把我想要组织这个画面的时候的思考过程写出来给你们看:
风格和主题:复古私宅室内,安静旧感,胶片质感。
主体和情绪:短发女孩准备离开住了很久的房间,有点舍不得,但已经决定走。
人物和动作:身体转向门口,手里拿着单程票,扶着纸箱,头还在回望。
约束:一个人,墙上有照片印记,地上只有纸箱和折叠椅,窗外下雨。
如果画面中只写主体与构图时,Prompt 是这样:
一名年轻短发女性站在房间里,看向镜头。
横构图,人物位于画面右侧三分线附近,左侧留出大面积负空间。
中景,浅景深,侧光从窗户进来,照亮面部。
复古室内,胶片感,干净构图,自然光影。

这张图出来的效果其实很好,因为人好看,但是呢? 他缺少了之前一直讲的叙事感。
人物位置、留白、光线、质感都有了。可左侧留白只是一块好看的空墙,它没有承担信息。
把同一个想法重新按执行顺序排列,完整 Prompt 是这样:
一名年轻短发女性,独自站在已经搬空的房间里。
她右手拿着一张单程火车票,左手扶着最后一个封好的纸箱。
身体已经转向门口,但头还在回望房间。
墙上有取下照片后留下的浅色长方形印记,地上只剩一把折叠椅。
窗外正在下雨。
横构图,人物位于画面右侧,左侧留出大面积空房间作为负空间。
中景,能看到她的上半身、手中的票和纸箱。
光线从左侧窗户进来,主要照亮她的侧脸和车票,房间其他地方偏暗。
车票、纸箱和墙面印记清晰可见,但不能比人物面部更抢眼。
复古私宅室内,轻微胶片感,自然真实的光影,安静克制的氛围。

老规矩,这两张图不是严格控制了人物造型和所有参数的模型评测,证明不了普遍规律。
他只负责演示一件事:车票、纸箱、墙面印记和回望动作出现之后,画面才从“一个人站在房间里”,变成“一个人准备离开”。
整个画面就有了一种叙事感
人物放右边,是为了让左边那间快被搬空的房子成为她回望的对象。
窗边的光也不只负责电影感,它把脸和车票提出来,让我们先看到决定,再看到舍不得。
第二组也一样,先按人的思考顺序想:
风格和主题:写实纪实感,清晨路边小修车铺,有生活气息。
主体和情绪:年轻女机械师正在把扳手递给年长男司机,两人都很专注。
人物和动作:女机械师半跪在左边,男司机站在右边,两个人都看着扳手。
约束:就两个人,黄色工具箱在中间偏下,银色扳手只有一把。
只写人物与构图时:
两个人站在修车铺里,看向镜头。
横构图,中景,人物分别位于画面左右两侧,中间形成稳定三角关系。
清晨侧光,背景简洁,写实风格,轻微胶片感。

人物、修车铺、清晨侧光都有了,要求的每一个元素也都在,但它更像一张员工合影。
完整版本是这样:
双人。
左边是一名年轻女机械师,穿蓝色工作服,半跪着,右手正把一把银色扳手递出去。
右边是一名年长男司机,穿棕色外套,站着,左手伸过来接扳手。
两个人都看着中间的扳手,不看镜头。
黄色工具箱放在两人之间偏下方的地面上。
银色扳手只有一把,正位于两只手之间。
横构图,中景,摄影机大致和两人胸口同高。
女机械师位于画面左侧,男司机位于右侧。
两人的脸和黄色工具箱形成稳定的三角关系。
背景卷帘门半开,保持简洁,不抢主体。
写实纪实风格,自然清晨侧光,真实生活感,轻微胶片质感。

这一组同样不是严格控制变量的模型评测,人物设定并不完全相同。
它想说明的还是同一件事:第一张告诉你“这里有两个人”,第二张让你看见“一件事情正在发生”。
一把正在被递过去的扳手,把动作、视线和人物关系串了起来。
这时三角构图才不只是平衡。它负责让视线从两张脸落到工具箱,再回到两只手之间的扳手。
看到这里,有人可能会觉得:这不就是把提示词写成一段故事吗?
其实不是。
很多人正好踩坑踩在这里。
她即将离开住了十年的房间,心中既有解脱又有不舍。
雨声敲打着窗户,仿佛也在为她的离开而难过,过往的回忆不断涌上心头。
发现了问题没有,上面这段话人能读懂,是因为我们会自动脑补纸箱、旧照片和迟迟没有迈出去的脚。
但模型呢?它也有可能出来一张你想要的效果,但是那个时候靠的就是它的随机性了。
正确方向是:
她右手捏着一张单程火车票,左手扶着最后一个纸箱。
身体已经转向门口,头却还在回望。
墙上有取下照片后的浅色印记,地上只剩一把折叠椅。
前者在替人物解释内心。
后者只写眼睛能看到的现场,却让读者自己读出了不舍。
所以完整版的核心不是写得更文学,而是:
先把故事想清楚,再强迫自己只写镜头能拍到的部分。
它更像导演在写分镜说明,或者摄影师在交代现场,而不是作家在写小说。
道具越多,故事不一定越完整。
一个事件先留一件核心道具,再加一两个环境痕迹。东西全塞进去,没有理清楚空间关系顺序,模型不懂,读者也不知道哪个重要。
两个人都看镜头,关系很容易断。
看对方、看共同物、故意避开对方,表达的是三种不同关系。视线要有目标。有兴趣的兄弟可以去研究一下图片的眼部视线热动力学,也蛮有意思的。
只写动作,不写动作停在哪一刻。
“递扳手”可能已经递完,也可能生成两把。写清“扳手位于两只手之间,正在递交”,画面才明确。
构图和证据互相打架。
你要求全身大远景,又希望看清一张小车票;要求浅景深,又希望远处墙面痕迹清晰。所以要先决定最关键的证据,再选景别。
一条能直接执行的叙事 Prompt,其实已经很接近一个单镜头的拍摄说明了。
里面有谁在场、在做什么、关键道具是什么、镜头站在哪,这一镜必须让观众看见什么。
我去翻了 Walt Disney Animation 关于故事部门的公开介绍,里面说故事艺术家不只考虑情节、角色和世界,还要同时想情绪、表情、时间、调度和取景。
美国电影摄影师协会聊剧本拆解时也提到:先找到人物目标和场景节拍,再让景别、机位、镜头运动和光线去响应这些变化。
所以“女孩要离开旧房间”这件事,不需要一上来就写十个镜头。
先拆成三个就够了:

三张图不是把同一个画面放大三次。
每一镜都换了信息任务。
这就是分镜最基础、也最容易被忽略的地方:景别不是装饰,切镜也不是为了显得像电影。每次变化,都应该多给观众一点新信息。
静态图可以这样写:
硬关系:几个人,谁在什么位置,身份与核心动作是什么。
可见证据:核心道具、动作停在哪一刻、人物看哪里、现场留下什么痕迹。
构图任务:景别、机位、第一视觉中心、哪些信息必须清楚或弱化。
风格氛围:摄影风格、光线、色彩和质感,只留必要的几项。
迁移成视频分镜,再给每一镜补两个问题:
这一镜新增什么信息?
它结束时,下一镜为什么必须出现?
如果第二镜只是换个角度重复第一镜,它就不一定需要存在。
如果一条 Prompt 同时塞了远景、中景和特写要完成的任务,也应该拆开。
上一篇开头那个问题,到这里可以回答了。
为什么有些 AI 图片第一眼好看,第二眼就忘?
因为它只把视觉元素摆对了,没有让元素之间发生关系。
真正的叙事 Prompt,也不是把文字写得像小说。
它更像导演在交代现场:谁在这里,事情停在哪一秒,什么东西必须被看见,镜头应该把我们的眼睛放在哪里。
当你开始这样想,得到的不只是一张更有故事的图片。
你也在练习另一种能力:把一段模糊的感受,拆成可以被拍、可以被生成、也可以被剪到一起的视觉动作。
这一步,就是从“会写生图提示词”,走到“会做画面”。