从长提示词到镜头卡(构想)
一条视频至少有四个不同的问题:素材是什么、动作如何发生、镜头怎样看见、后期如何形成节奏。把这四层都塞进一段长提示词,往往难以判断失败发生在哪一层。更稳妥的起点是写一张简短的镜头卡:角色与场景、动作起点和终点、镜头位置、预期时长、声音节拍、交付标准。 素材层:分别指定角色身份、服装、道具和场景参考的职责。参考图负责外观,并不自动解决动作路线或空间连 续性。 动…
10 条公开碎碎念
一条视频至少有四个不同的问题:素材是什么、动作如何发生、镜头怎样看见、后期如何形成节奏。把这四层都塞进一段长提示词,往往难以判断失败发生在哪一层。更稳妥的起点是写一张简短的镜头卡:角色与场景、动作起点和终点、镜头位置、预期时长、声音节拍、交付标准。 素材层:分别指定角色身份、服装、道具和场景参考的职责。参考图负责外观,并不自动解决动作路线或空间连 续性。 动…
image2.5 更新之后,在提示词方面,想要做真实感,就更不用像2.5一样,还要堆一些负面提示词,比如“轻微的噪点”“模拟胶片颗粒”“细腻的纹理”这种词了。 我发现,现在只需要写“真实皮肤的纹理”,或者“手机摄像的低范围动态压缩”,它给的图片效果就已经很真实了。 我这张图片就是这样的效果,其实很简单,贴在下面给大家看一下。 原相机近距离自拍9:16 ,真实…
我们经常会遇到一个视频里面几个画面很好看,但是我们自己又截图又很麻烦,想偷个懒,那应该怎么做呢? 我一般是会直接把视频下载下来,然后扔给GPT,让GPT帮我把每一个镜头的视频帧进行截图,然后保存到一个文件夹下面。这样的话,我就可以对于每一个镜头进行选取了。如果你对图片的标题命名有什么要求?也可以在后面和它对话的时候添加。 很简单的一段提示词,其实就是下面这样…
1. 1、最重要的主体尽量放在开头,并让它成为句子的主语。 2. 2、直接描述最后能看到的画面,不要先写一堆“请创建、请添加”。它不是GPT一样的交互式编辑图像模型。 3. 3、一个句子尽量只处理一个视觉单元。 4. 4、人物的信息跟人物放在一起,环境的信息跟环境放在一起。 5. 5、“悲壮、孤独、勇敢”这类抽象词,要继续拆成眼神、姿态、道具、环境和光线。…
最近在研究AI视频领域的创作,意外之间就进入到了马导的归源宗。 链接在这:马导B站账号 拜读完他的4节直播课之后。有几点我觉得是有必要记下来的。 首先就是AI的本质,它是一个概率统计学的问题,它所来源的知识都是我们过往的已有的知识。所以想要发挥AI更好的功能,我们不仅是要学习AI,更重要的是回归本源,在自己的个人领域里面,打好扎实的基础。对于专业知识的理解,…
一、可行性分析 从产品角度来看,这个东西是否是和产品定位相符的? 从技术角度来看,技术是否可行?,成本是可控的? 二、写设计文档 在初步判断方案可行之后着手开始写设计文档 设计文档里面要描述清楚自己的需求、架构、UI设计。 三,原型设计 我也叫它可视化的设计。能够帮你快速判断一些位置是否正确,让你感官更强烈一点。 四,可以开始写代码了。 五、测试
很多年轻人不知道自己想要什么,只是跟着社会上的路径来迷茫的走来走去:别人考研、我也要考研,别人考公,我也要考公。 不能说这两个是错的,而是要看你是否知道自己的目的。漫无目的的选择一件“看似正确”的事情,是不可能产生好结果的。 当一个机会已经普及到所有普通人都已经知道的时候,它往往已经不是机会了。 AI发展迅速,首先要淘汰的就是个人能力最接近“工具”的人:整理…
AI为什么很多时候不能理解中式审美,反反复复就是那几种样式? 我最近反复的思考感觉可以就是下面几个原因。 1.我们的审美断层了。 为什么这样说呢?因为回头往从前看,我们的老祖宗们给我们留下来的审美是有很多的,而且也很高雅,比如:秦汉的大气蓬勃,唐朝的雍容华贵,宋朝的极简留白,明朝的温润克制……这本身就是一套已经成体系的视觉规范化语言。 但是我们都知道,在过去…
1.AI现在大爆发,在做事/做项目、造工具之前先调研,比如想要做项目,先去GitHub上逛一圈,再去做决定。 2.提示词永久不变的框架:角色-人物-格式(RTF) 3.无论是提示词还是skill,永远不是一蹴而就的,都是不断的迭代和修改出来的,循环往复,直至满意。 重点是要自己知道验收的标准和前进的标准。 衡量:4A 评估法(来自AI领导力那本书) 真正拉开…
这个思路来源一个国赛的老师。 他是用博物馆的一个例子举的例子。 他把未来AI的模型比喻成博物馆里面的一个一个的物件,而人比喻成博物馆里的策展人。 博物馆里的展品就像以后的 AGENT、skill、harness、engines……等等类似的概念, 而人要做的不再是去手敲代码开发,更应该是像策展人一样,哪个展厅需要摆那些物品,对应的就是哪个功能/软件,需要哪些…