本页目录
构图是语法,故事是语义:AI生图的双层视觉导演法(上)
把构图与故事拆成画面语法与语义,解释为什么很多 AI 图片第一眼好看、第二眼却留不下内容。
页面准备好后会自动显示。
注:本篇文章的内容仅代表个人经验的分享和看法,并不代表这些就是正确的观点(叠个甲)
AI出来之后有一个很有意思的现象,不知道大家有没有注意到
从 AI 出现之后,我们判断一张图片的好坏,不知不觉变成了三件事:真假、质感、构图。
人物像不像真人,皮肤有没有毛孔,画面好不好看——现在夸一张图,翻来覆去就是这几个词。
其实对现在的 AI 生图模型来说,上面这些问题,都已经解决得差不多了。
但是当我去回顾一些摄影大赛的作品之后,在对比大部分的AI作图,我发现了一个现象。
AI能做出来的图,
好看是真的好看(甚至可以在摄影比赛里面获奖,狗头保命)
但是当你刷到它给他点完赞,要完提示词之后,自己出来了个一样的图之后,当时很开心,但是过两天再去回头想想的时候发现,好像记不得那个图片是讲什么的了,只记得它很美
这种图,第一眼挺好看,第二眼就忘了。

很多人为了让画面呈现一些特别的样式,会拼命的往画面里加东西:道具、人物、氛围,能堆的都堆上。最后却只能得到一张还不错的图。
为什么?
因为我们一直在用一套统一的标准想法去作图,却很少真正去管:这张图到底在说什么?
我们都在追求一张图片的构图、光影、人像。
全都忽略了一张图的情绪、距离、时间。
这样的作图我越做越觉得可惜,觉得偏离了摄影的意义,
这其实不是图片好不好看的问题,而是我们几乎把所有的描述都去往构图成立上面来写了,却在“让画面有东西可读”这件事情上越走越远。
所以这组文章,我想把两个经常混在一起的东西拆开:构图和故事/叙事。
怎么理解它们各自在管什么?为什么很多 AI 图片构图在线,叙事却是空的? 这一篇先做一个整体的介绍 下一篇,再讲怎么把这两层真正写进提示词里。
这是一个方便创作的比喻,不是什么必须背下来的理论。
怎么样才能举一个好例子呢?
“一个漂亮的人,站在漂亮的房间里,接受漂亮的光。”
就比如上面这句话,语法全对,但是我们读过之后依旧会觉得平平无奇。
没有语病,也没有信息。
所以其实图片也是一样的。
构图更像画面的语法。
它一般的词掌控着画面的几何关系、光线、色彩、比例与留白……
而故事更像画面的语义。
它掌管的是画面的情绪、叙事,通常是通过主题的动作、表情、与环境的关系、被摄者和拍摄者之间的距离关系来控制……
简单一点说:
构图决定你先看哪里,故事决定你看到了什么。

这两层其实并不是一山不容二虎的存在,而是唇亡齿寒的关系。
只有故事没有构图,信息全挤在一起,读者不知道先看哪里。
只有构图没有故事,画面很稳、很顺、很漂亮,但像一篇没有营养的文章。
真正好的画面,通常是两层都在线,只是不同题材的比例不一样。
一张商品白底图,本来就更看重形状、材质和信息清楚。
一张纯视觉海报,也可以把色彩、形式和冲击力推到极致。
所以我不是说每张图都必须塞进一个完整剧情。单独把某一层做到极致,照样会抓人。
但如果你的目标是“电影感”“纪实感”“让人有联想”,如果你想要让你的图片能够为视频服务,那只写镜头、光线、风格和构图,通常不够的。
因为真正的电影感,不是加一层黑边和青橙色调。
它至少要让人感觉:这一秒是从某件事情里截出来的,让人觉得这张图片是有时空观念存在的
我们很容易把“画面内容多”理解成“画面信息多”。
桌上放一本书、一杯咖啡、一封信,再来一盏旧台灯,墙上挂几张照片。
东西确实多了。
可如果人物没有使用这些东西,它们彼此之间也没有关系,那就只是把五个名词摆进了同一张图。
一张火车票放在桌上,只能说明桌上有票。
一个纸箱放在墙角,也不自动等于有人准备离开。
两个角色同时出现在画面里,更不代表两个人之间有一定的关系。
这就是“元素”和“故事”的区别。
元素讲的是:画面里有什么。
故事讲的是:这些东西为什么同时出现在这里,它们之间正在发生什么。
很多 AI 图片看起来很满,却还是空,原因也在这里。
它有角色、有道具、有场景、有氛围,但这些东西像一份各自完成任务的的清单:人物负责漂亮抓人,灯光负责电影感,道具负责复古,背景负责丰富层次。
谁也没有和谁发生关系。

最后每一项都做对了,整张图却没有一个真正的中心。
这个中心不一定是画面里最大、最亮的东西。
它也可以是一个动作、一段视线,或者一个让人意识到“之前发生过什么”的痕迹。
构图真正该做的,是把这些信息组织起来,让整个画面能够引导用户阅读,产生一种叙事感。
为了让我能够站住脚一点,我去核对了 World Press Photo 公开的评审规则。
它给评审的标准里,明确分开写了视觉质量、故事和代表性。
视觉质量包括创造力、技术与视觉风格;故事则看作品讲了什么、为什么重要,以及摄影师用什么方式接近这个故事。
其中更有意思的是评审流程。
第一轮主要看视觉质量。后面的轮次才逐步加入标题、短说明、长说明,以及摄影师为什么拍、怎么拍这些背景。
这件事本身就很说明问题:
第一眼能不能抓住人,和这张图最终能不能站住,是两道题。

2024 年年度照片《A Palestinian Woman Embraces the Body of Her Niece》被评审提到时,构图与故事也没有被拆开评价。(图片由于版权问题没办法在这里展示,感兴趣的兄弟可以去搜搜看)
评审认为它的画面处理克制、尊重,同时在字面和隐喻上都让人感受到难以想象的失去。
但我不准备拿这样的新闻照片,硬拆成一套“照着写就能出片”的公式。真实苦难也不该被拿来当提示词模板。
但它至少提醒我:真正让一张照片留下来的,从来不是“三分线用对了”这么简单。
构图之所以有力量,是因为它在保护、强调或隐藏某个具体的信息。
换到 AI 图片里也是一样。
我们不需要复制摄影大赛的题材,却可以学它的思考方式:画面好不好看是一层,它有没有让人看见一件具体的事,是另一层。
现在大家都去追求构图,我觉得第一个原因,和我们平时接触到的教学方式有关。
构图是更容易被系统传授的。
三分法能画线,景别能分类,焦距能写数字,留白、对称、引导线也都能找案例反复练习。
你学完之后,马上就能检查自己有没有做到。
但是故事感就麻烦多了。
它更多依赖观察力、生活经验,以及你对人的理解。

一个人犹豫时,身体和眼睛会不会朝着同一个方向?
一个住了十年的房间被搬空后,墙面和地面会留下什么?
两个人关系紧张时,他们会看向对方,还是故意绕开对方?
什么动作表示“已经决定”,什么动作又说明“其实还没放下”?
这些东西没有一条像三分法那么清楚的线,也很难压成一张万能词表。
所以我们学了很多“怎么把图拍好看”,却很少真正练习“怎么把一件事变成眼睛能看到的画面”。
一到写提示词,就会本能地抓住自己熟悉的部分:构图、镜头、光线、色彩、风格。
至于故事,则留给“孤独、命运感、不舍、治愈、诗意”这些抽象词去完成。
另一个原因,出在我们给模型的信息上。
你说“右侧三分线、浅景深、侧逆光、胶片感”,它基本知道应该把这些东西放在哪里。
可你说:
她刚刚决定离开住了十年的房间,但又有点舍不得。
这里面除了“她”和“房间”,几乎没有东西可以直接画出来。
“决定离开”长什么样?
“住了十年”会在哪个位置留下证据?
“舍不得”应该让她的手、身体和眼睛分别做什么?
人读这句话,会自动用自己的经历补全。
模型也只能补,但它补出来的通常是更常见、更安全的视觉模板:低头的女孩、忧郁表情、蓝灰色、窗外下雨。
于是你感觉自己已经写了很多情绪,画面却还是没什么差别。
这其实不是情绪词完全没用。
而是你把最关键的那一步跳过去了:情绪没有变成模型可以理解的视觉语言(翻译)。

这也不能简单归结成“模型不懂故事”。
更准确的说法是:我们把只有人脑能补全的部分,原封不动丢给了模型。
模型可以替你填空,但它大概率会用自己最熟悉的答案,而不是你脑子里的那一个瞬间。
现在我们至少把问题拆清楚了。
构图和故事不是同一层东西。
构图负责安排画面里的信息,故事负责让信息之间产生关系。
AI 图片容易“好看但空”,不只是模型能力问题,也因为我们习惯写可量化的视觉规则,却把真正的故事留在抽象情绪里。
下篇会从这里原样接着往下走。
怎么在提示词里同时写清楚构图和故事?
我会先拆开“构思的顺序”和“真正写提示词的顺序”,再用离开旧房间、修车铺递扳手两组完整案例,把硬约束、可见证据、构图任务和风格氛围一步步合起来。
最后还要解决一个很容易误解的问题:有故事感的提示词,不是把提示词写成小说。
当这一步跑通之后,它也不只对静态图片有用。你会发现,同样的思考方式可以继续变成视频分镜和脚本。