文章摘要
《AI叙事视频生产系统》第一篇:从公开案例的问题边界出发,建立叙事、资产、空间、镜头与粗剪反馈五层连续性系统。

AI叙事视频生产系统01:别先写长Prompt,先建立连续性系统

单个镜头看起来惊艳,并不代表它能和下一镜剪在一起。叙事视频需要角色身份、服装状态、空间方位、动作结果、声音和光线在镜头之间持续成立;而多数生成模型不会自动记住上一镜发生了什么。于是,生产瓶颈从“能不能生成一条好镜头”转向“能不能让几十条镜头共同讲清一件事”。

一、案例能告诉我们什么,不能告诉我们什么

Higgsfield 曾公开发布 Hell Grind 项目 brief。项目方自述该项目在长叙事生产中遇到人脸变化、机位移动后空间崩坏、声音漂移和场景失去地理关系等问题,并描述了资产表、空间布局和按场景块协作等方法。这些材料适合作为生产问题的案例来源,但项目方所称片长、团队人数、生成周期和预算并非本文独立核验结论,也不能当作其他团队的效果承诺。

本文只从公开案例暴露的问题出发,提出一套自建的工程方法。它不是对原 brief 的翻译,不使用原项目角色、剧情、对白、画面、附件或工作文件。

二、连续性系统的五层结构

  1. 叙事层:这一场戏改变了什么?角色进入时和离开时分别处于什么状态?
  2. 资产层:角色、地点、道具有哪些固定属性,哪些属性会随剧情变化?
  3. 空间层:人物、地标、机位、180°轴和光线方向如何定义?
  4. 镜头层:每镜的首帧占位、动作节拍、终点状态和验收条件是什么?
  5. 反馈层:粗剪缺什么镜头,失败版本说明哪条约束无效,下一轮只改什么?

五层之间必须可追溯。剧本中的状态变化应落实到资产版本;资产版本和空间卡应进入镜头说明;镜头结果应回到粗剪;粗剪提出的缺镜再进入下一轮生成。长 Prompt 只是一种输入形式,不能替代这套状态流。

三、从一场最小样片开始

不要一开始挑战完整短片。一个可验证的最小 vertical slice 可以设为:一处室内地点、两名角色、一个关键道具、六到十个镜头。它需要覆盖建立空间的全景、正反打、道具交接、角色离场和一个补救用切镜。这样既能暴露身份与空间问题,又不会让变量多到无法归因。

开拍前写一张场景状态表:

对象进入状态变化离开状态
角色 A站在桌左,空手拿起蓝色盒子面向门,右手持盒
角色 B门边等待向桌移动一步停在桌右,注视 A
蓝色盒子桌面中央被 A 拿起位于 A 右手

这是自有示例。它的价值在于把“保持一致”改写成可观察、可验收的条件。

四、资产不是图库,而是带状态的对象

角色资产至少包含身份图、全身比例、服装和关键细节;地点资产至少包含主要方向、地标、入口和光源;道具资产需要结构、尺寸关系和可见面。互斥状态应拆开管理,例如外套穿着/脱下、道具完好/损坏、白天/夜晚。不要把所有状态塞进一张万能参考图,再要求模型自行理解剧情时序。

每个资产可记录四组字段:固定属性、当前状态、允许继承、禁止继承。例如“人物脸型与发色”可继承,“上一场雨中的湿衣状态”未必能继承。状态拆分不是增加素材数量,而是减少模型面对的冲突指令。

五、把空间写成每场戏的公共输入

空间卡只描述稳定地理关系,不混入临时动作。建议包括:画面左侧与右侧地标、人物初始位置、关键距离、主机位一侧、180°轴、主要光线方向。尽量使用“画面左/右”和明确地标,而不是“角色自己的左边”。同一场戏的每个镜头都复用空间卡,并在切镜后重申人物朝向和视线。

SCENE GEO
- Door: frame-left, 3 m from table
- Window: frame-right, key light from right to left
- A starts left of table, facing B
- B starts near door, facing frame-right
- Camera stays south of A-B axis

模板是本文自建示例,不是 Hell Grind 原始提示词。

六、镜头说明写“可观察行为”

“角色很紧张”很难验收;“角色停顿半秒,视线从门移到盒子,右手悬在桌沿,没有拿起盒子”则可以检查。每镜建议明确:对象数量、首帧占位、活动资产版本、空间约束、镜头运动、低密度动作节拍、末帧状态和失败条件。动作越复杂,越应拆成多镜,而不是继续加形容词。

七、一次只改一个变量

失败后同时改参考图、动作、运镜、时长和提示词,会让结果无法归因。更稳妥的迭代日志只允许一项主要变更:

shot: S01-04
version: v03
change: remove camera orbit; keep locked medium shot
expected: preserve hand-to-prop contact
result: PASS / FAIL
decision: use / split / stop

当同一镜头持续失败,不要无限润色。可选择拆镜、减少同时动作、改用切镜、锁定机位或把文字与 Logo 留到后期。止损条件应在生成前写下,而不是预算耗尽后再补。

八、让粗剪尽早参与生产

完成几个关键镜头后就进入粗剪,检查信息是否成立、视线是否顺畅、动作是否缺桥接。粗剪输出的是缺镜清单,例如“需要一个门把手切镜掩盖人物转身”“需要一条全景重新建立空间”,而不是笼统地要求“再生成一些素材”。剪辑由此成为生成的上游约束,而不只是最后的装配工序。

九、本篇的完成标准

在进入批量生成前,应至少能回答:每个角色当前是什么状态;每个地点的轴线和地标在哪里;每镜从什么状态开始、以什么状态结束;失败时只改哪个变量;粗剪缺镜如何回流。如果这些问题仍依赖某个人的记忆,连续性系统尚未建立。

下一篇将继续讨论“资产不是图库”:如何拆分角色、地点、道具及剧情状态,并建立可继承与不可继承规则。

来源与披露:公开案例信息来自 Higgsfield 曾公开的 Hell Grind 项目 brief;本文已明确区分项目方自述与作者工程推论。文章由作者独立中文撰写,使用 AI 辅助进行结构整理和文字校对;未复制第三方附件、原片素材、角色、对白或工作文件。

以上内容不代表本平台立场,仅供读者参考