AI叙事视频生产系统01:别先写长Prompt,先建立连续性系统

AI叙事视频生产系统01:别先写长Prompt,先建立连续性系统
单个镜头看起来惊艳,并不代表它能和下一镜剪在一起。叙事视频需要角色身份、服装状态、空间方位、动作结果、声音和光线在镜头之间持续成立;而多数生成模型不会自动记住上一镜发生了什么。于是,生产瓶颈从“能不能生成一条好镜头”转向“能不能让几十条镜头共同讲清一件事”。
一、案例能告诉我们什么,不能告诉我们什么
Higgsfield 曾公开发布 Hell Grind 项目 brief。项目方自述该项目在长叙事生产中遇到人脸变化、机位移动后空间崩坏、声音漂移和场景失去地理关系等问题,并描述了资产表、空间布局和按场景块协作等方法。这些材料适合作为生产问题的案例来源,但项目方所称片长、团队人数、生成周期和预算并非本文独立核验结论,也不能当作其他团队的效果承诺。
本文只从公开案例暴露的问题出发,提出一套自建的工程方法。它不是对原 brief 的翻译,不使用原项目角色、剧情、对白、画面、附件或工作文件。
二、连续性系统的五层结构
- 叙事层:这一场戏改变了什么?角色进入时和离开时分别处于什么状态?
- 资产层:角色、地点、道具有哪些固定属性,哪些属性会随剧情变化?
- 空间层:人物、地标、机位、180°轴和光线方向如何定义?
- 镜头层:每镜的首帧占位、动作节拍、终点状态和验收条件是什么?
- 反馈层:粗剪缺什么镜头,失败版本说明哪条约束无效,下一轮只改什么?
五层之间必须可追溯。剧本中的状态变化应落实到资产版本;资产版本和空间卡应进入镜头说明;镜头结果应回到粗剪;粗剪提出的缺镜再进入下一轮生成。长 Prompt 只是一种输入形式,不能替代这套状态流。
三、从一场最小样片开始
不要一开始挑战完整短片。一个可验证的最小 vertical slice 可以设为:一处室内地点、两名角色、一个关键道具、六到十个镜头。它需要覆盖建立空间的全景、正反打、道具交接、角色离场和一个补救用切镜。这样既能暴露身份与空间问题,又不会让变量多到无法归因。
开拍前写一张场景状态表:
| 对象 | 进入状态 | 变化 | 离开状态 |
|---|---|---|---|
| 角色 A | 站在桌左,空手 | 拿起蓝色盒子 | 面向门,右手持盒 |
| 角色 B | 门边等待 | 向桌移动一步 | 停在桌右,注视 A |
| 蓝色盒子 | 桌面中央 | 被 A 拿起 | 位于 A 右手 |
这是自有示例。它的价值在于把“保持一致”改写成可观察、可验收的条件。
四、资产不是图库,而是带状态的对象
角色资产至少包含身份图、全身比例、服装和关键细节;地点资产至少包含主要方向、地标、入口和光源;道具资产需要结构、尺寸关系和可见面。互斥状态应拆开管理,例如外套穿着/脱下、道具完好/损坏、白天/夜晚。不要把所有状态塞进一张万能参考图,再要求模型自行理解剧情时序。
每个资产可记录四组字段:固定属性、当前状态、允许继承、禁止继承。例如“人物脸型与发色”可继承,“上一场雨中的湿衣状态”未必能继承。状态拆分不是增加素材数量,而是减少模型面对的冲突指令。
五、把空间写成每场戏的公共输入
空间卡只描述稳定地理关系,不混入临时动作。建议包括:画面左侧与右侧地标、人物初始位置、关键距离、主机位一侧、180°轴、主要光线方向。尽量使用“画面左/右”和明确地标,而不是“角色自己的左边”。同一场戏的每个镜头都复用空间卡,并在切镜后重申人物朝向和视线。
SCENE GEO
- Door: frame-left, 3 m from table
- Window: frame-right, key light from right to left
- A starts left of table, facing B
- B starts near door, facing frame-right
- Camera stays south of A-B axis
模板是本文自建示例,不是 Hell Grind 原始提示词。
六、镜头说明写“可观察行为”
“角色很紧张”很难验收;“角色停顿半秒,视线从门移到盒子,右手悬在桌沿,没有拿起盒子”则可以检查。每镜建议明确:对象数量、首帧占位、活动资产版本、空间约束、镜头运动、低密度动作节拍、末帧状态和失败条件。动作越复杂,越应拆成多镜,而不是继续加形容词。
七、一次只改一个变量
失败后同时改参考图、动作、运镜、时长和提示词,会让结果无法归因。更稳妥的迭代日志只允许一项主要变更:
shot: S01-04
version: v03
change: remove camera orbit; keep locked medium shot
expected: preserve hand-to-prop contact
result: PASS / FAIL
decision: use / split / stop
当同一镜头持续失败,不要无限润色。可选择拆镜、减少同时动作、改用切镜、锁定机位或把文字与 Logo 留到后期。止损条件应在生成前写下,而不是预算耗尽后再补。
八、让粗剪尽早参与生产
完成几个关键镜头后就进入粗剪,检查信息是否成立、视线是否顺畅、动作是否缺桥接。粗剪输出的是缺镜清单,例如“需要一个门把手切镜掩盖人物转身”“需要一条全景重新建立空间”,而不是笼统地要求“再生成一些素材”。剪辑由此成为生成的上游约束,而不只是最后的装配工序。
九、本篇的完成标准
在进入批量生成前,应至少能回答:每个角色当前是什么状态;每个地点的轴线和地标在哪里;每镜从什么状态开始、以什么状态结束;失败时只改哪个变量;粗剪缺镜如何回流。如果这些问题仍依赖某个人的记忆,连续性系统尚未建立。
下一篇将继续讨论“资产不是图库”:如何拆分角色、地点、道具及剧情状态,并建立可继承与不可继承规则。
来源与披露:公开案例信息来自 Higgsfield 曾公开的 Hell Grind 项目 brief;本文已明确区分项目方自述与作者工程推论。文章由作者独立中文撰写,使用 AI 辅助进行结构整理和文字校对;未复制第三方附件、原片素材、角色、对白或工作文件。
