把两张图放在一起,问题很明显。
返图的人物更正、更居中,头部向画面左侧倾斜的幅度减弱了。原图背景里几条横向穿过画面的金色光带,也被简化成更普通的夜景散景。
可这些信息并不是没有写进 Prompt。
里面明确写了:
人物占画面约七成。
巨大蓝色花冠与黑色盘发集中在上方偏左。
头部向画面左侧倾斜。
浅黄色与薄荷青色衣料从画面下方中央向右下方展开,构成左上至右下的对角线动势。
背景维持低曝光,以黑褐暗部、暖金光带、金黄暖白圆形散景和少量红色点光形成强烈冷暖分离。
也就是说,反推阶段已经观察到了倾斜、对角线和横向光带。
图像模型在生成时,仍然把它们改写成了更常见、更稳定的人像构图。
这种偏差不能全部甩给 Prompt,也不能全部归因于模型。
实际判断时,我会把问题分成三种:
这一组更接近第三种,同时也说明第二种仍有继续优化的空间。
如果下一轮只追加一长串「不要居中、不要正面、不要减弱倾斜」,未必能解决。
更有效的做法,是把头部倾斜、人物偏位、左上到右下的身体和衣料动势提前,合并成一条更强的非对称空间骨架,再减少与它竞争的装饰细节。
但即使这样,也不能承诺下一张就会 1:1 回到原图。
这就是我想公开写出来的边界: 提示词写到了,不等于模型一定会做到。 所以一组提示词,质感不行的时候尝试新开对话窗口多生成几次,不要只生成一次就放弃了
为什么我目前最推荐搭配 GPT‑5.6 sol
这套 Skill 换其他能看图、能执行 Agent Skill 的模型,也可以用。
但在我目前的工作流里,我最推荐搭配 GPT‑5.6 sol (毕竟我一切都是基于GPT来开发的)。
原因不是它会自动给图片加一层「高级感」,而是它更适合处理人像反推里那些彼此关联、又很容易写乱的关系。
比如:
GPT‑5.6 sol 更适合承接这套高信息密度的中文规则,先看懂关系,再组织成能直接生图的表达。
它也可以在同一条工作流里继续检查字段有没有漏掉、调用生图、比较参考图和返图,少掉很多来回复制粘贴。
但这里要区分两个环节。
GPT‑5.6 sol 负责的是看图、推理、组织反推词和执行工作流;最终像素仍然由实际调用的图像生成模型完成。
所以我说「搭配效果最好」,说的是我当前这套 Skill 和实际使用流程中的判断。
它不是跨所有模型的统一排行榜,也不代表 GPT‑5.6 sol 能消除图像生成本身的随机性。
色卡模式,不是给图片贴几个好看的色块
除了结构拆解和完整 Prompt,这个 Skill 还有色卡输出。
我把它叫作色卡模式,但它不是另一套滤镜,也不是为了让结果看起来更专业。
它真正解决的是: 我们看到一张图配色舒服,却说不清这些颜色之间是什么关系。
以刚才那张复古卧室人像为例。
如果只写「青绿色调」,模型可能把墙、床、皮肤、阴影和窗光全部染成同一种绿。
但原图真正的配色关系更接近:
-
#788B76 |雾青绿色环境基底|约 45%
-
#ACC1B4 |窗边薄雾与浅色床品|约 11%
-
#282A1F |头发、镜框和室内深色重心|约 9%
-
#ADA78A |肤色与复古花布的暖灰中间调|约 9%
-
#D2E2DC |窗光和床褥的浅青白高光|约 5%
-
#57604B |墙面、织物褶皱和环境暗绿|约 5%
大面积雾青绿负责环境,小面积深色负责压住画面,浅青白只用在窗光和高光位置,肤色与花布又留了一点暖灰。
这才是色卡值得学习的地方。
它不只是告诉你「图里有哪些颜色」,还要告诉你谁是主色、谁负责明暗、谁只是很小比例的跳色。
如果你只想学习构图、动作和质感,不一定每次都要加色卡。
但如果你的目标是尽量复刻原图的色彩体系,我建议把完整反推词和色卡一起交给生图模型。
这会比只写「青绿色」「暖金色」「低饱和」多一层明确的颜色约束。
同样要注意,色卡也不是像素锁色。
材质、曝光、环境光和图像模型本身,都会继续改变颜色。它能帮助你保住配色关系,却不能承诺最终每一个像素都和原图完全一致。
这套 Skill 到底能做什么,不能做什么
为了让你方便了解,我把边界直接列出来。
它能做的是:
-
把人像参考图拆成中文可读的视觉控制项;
-
提炼画幅、机位、人物位置、裁切、视线、表情与姿态;
-
识别手势、道具、接触、遮挡和前后层次;
-
分开处理光线、曝光、色彩、材质与成像质感;
-
对明显的美颜、柔焦、颗粒、压缩和渲染特征建立成像描述;
-
给出可以直接复制、也方便继续修改的完整中文 Prompt;
-
在需要时提供参考色卡,帮助学习和约束配色关系。
它不能保证的是:
普通反推也不会自动生图。
你只说「反推这张图」时,它交付的是结构拆解、必要的参考色卡和完整 Prompt。
只有你明确要求继续生成、测试或校准,才会进入返图和比较环节。
这个边界很重要。
因为反推和生图是两个不同任务。没有得到授权时,Skill 不应该为了证明自己好用,就擅自改 Prompt、连续重试,或者把随机生成的一张图包装成标准答案。
怎么使用
安装命令:
npx skills add nuyoah-ai-works/nuyoah-image-reverse-prompt -g -y
安装后,上传一张参考图,直接说:
使用南鸢图片反推拆解这张参考图,给我参考色卡和可直接生图的完整中文提示词。
公开项目地址:南鸢图片反推 Skill
如果你更在意人物结构,可以只要求反推,不加色卡。
如果你特别在意原图的配色关系,就明确要求「同时输出参考色卡」,再把色卡和完整 Prompt 一起用于生成。
第一张返图出来以后,也不要一上来就改十几个地方。
先只检查三件事:
-
人物位置、倾斜、裁切和空间骨架有没有漂;
-
视线、手势、接触与遮挡有没有写反;
-
主色关系、光线方向和成像质感有没有变成另一套。
然后判断问题到底出在观察、提示词表达,还是模型边界。
这个判断,比继续往 Prompt 里堆更多形容词重要得多。
我做这个 Skill,不是为了替你猜中某一段神秘 Prompt。
我更想做的是:当你看到一张喜欢的人像时,不再只会说「好有氛围感」,而是能看懂它为什么成立,并把这种理解变成下一张图里可以继续控制的语言。
它不负责 1:1 复制别人的答案。
它负责帮你建立自己的视觉判断。