预演台白模控镜:AI精准还原镜头与人物运动

近期AI视频生成工具的迭代让行业关注度持续提升,某AI视频创作工具推出的白模参考功能,让AI生成视频的镜头可控性有了显著突破。此前看到某影视创作博主的分享,其利用3D预演素材生成的视频,在构图、人物动作上与原始素材完全一致,这样的效果让我决定亲自测试这套流程。
我亲自进行了测试:将提前制作的灰白3D白模视频导入生成工具,得到的成片与原始白模在人物走位、镜头运动上严丝合缝,无论是人物走到护栏边的时机,还是镜头从背后绕到侧面的轨迹,甚至最后俯拍的高度,都完全匹配我在3D场景中提前排布的设计,没有任何偏差。
这些白模视频是通过某AI视频创作平台的预演台功能制作的:只需上传一张场景图,平台就会自动重建出3D白模场景,你可以在其中直接摆放人物、调整机位、设计走位,完成镜头编排后录制视频,再导入专业AI视频模型生成成片,整个过程不需要专业建模技能,也不用编写代码。
这几天我完整跑通了这套流程,从单张场景图到最终成片,还将难度提升到了当前能想到的上限:15秒时长、四个机位切换、包含镜头升降运镜。接下来我将详细分享整个过程和每一步的操作细节。
镜头可控性的核心:白模的作用
在这个专业AI视频模型正式推出初期,我测试生成的多条视频都一次通过,没有反复重抽。这时很多人会疑惑,既然AI生成的画质已经足够好,为什么还要额外制作白模?其实这两者解决的是完全不同的问题。
AI模型可以轻松保证生成视频的画质、物理逻辑和人物一致性,但想要精准匹配自己预设的镜头语言,单纯靠文字提示词很难实现。提示词能保证生成内容的质量达标,却很难锁住你想要的镜头意图。
举个简单的例子,如果你想要镜头从水晶吊灯高度缓缓下降,同时向前穿过大厅,让画面中央的人物逐渐变大,用文字提示词生成的结果往往是画面符合描述,但镜头高度固定、机位平推,完全偏离你的预期。质量达标和意图达标是两回事,文字提示词可以保证前者,却很难锁住后者。
在传统影视制作中,导演负责确定镜头的运动轨迹和调度,摄影师负责执行拍摄。而当你用文字提示词让AI生成视频时,相当于把这两个工作全部外包给了模型,机位摆放、镜头高度、切换时机都由模型决定。虽然当前的AI模型构图能力已经不错,但最终呈现的镜头未必是你想要的。
问题的核心在于,我们脑海中的镜头是具体的空间关系,传递给AI模型时需要经过两次翻译:先压缩成文字,再由模型展开成画面,每一次翻译都会丢失大量细节,而且你无法干预第二次翻译的过程。而白模就是解决这个问题的空间锚点,通过提供可见的3D场景,让AI模型的可控性大幅提升。
在预演台功能推出之前,获取白模的方式主要有三种:学习专业建模软件Blender,学习成本极高,需要数月时间;用ComfyUI搭配ControlNet搭建工作流,门槛不亚于学习代码;让AI辅助编写代码生成白模,需要一定的技术基础,调整运镜也很繁琐。而预演台功能则提供了更简单的第四条路径:上传一张场景图,等待几分钟即可自动生成可编辑的3D白模场景。
完整流程:从单张图到多机位成片
接下来以宴会厅镜头的制作为例,完整展示预演台的使用流程,这也是我本次测试中最完整的一条成片。
第一步:从单张图片生成3D场景
首先在创作平台的无限画布中,通过右键菜单新建预演台,或是直接上传场景图并一键创建预演台。我使用内置的图像生成工具制作了一张宴会大厅的参考图:中央悬挂水晶吊灯,双层拱廊环绕,尽头是铺有红毯的大理石旋转楼梯,整个过程仅用25秒。
进入预演台后,点击创建场景并上传参考图,系统会自动完成提交分析、搭建场景、优化细节等六个步骤,官方标注的耗时在4到7分钟,实际测试中复杂场景需要12分钟左右,而且即使关闭页面,任务也不会中断。最终生成的宴会厅场景包含112个独立部件,每个柱子、拱廊、楼梯都可以单独选中,空间层次和遮挡关系与参考图基本一致,无需任何建模基础就能直接使用。
第二步:熟悉片场界面
预演台的界面分为三个核心区域:右侧图层区展示场景中的所有元素,包括模型、人物、机位和灯光,点击任意元素就能查看和修改其属性;底部时间轴用于编排镜头运动,每个对象都有独立轨道,轨道上包含路径片段和关键帧;右上角的小窗是机位监视器,实时显示当前选中机位的画面,也就是最终录制的效果。
需要特别注意监视器顶部的开关选项,务必关闭“人物名牌”功能,否则人物头顶的标签会被烧录到每帧画面中,对后续的AI生成造成干扰。
第三步:添加人物并设计走位
点击左侧栏的“新建人物”,人物会直接出现在场景中心。在属性面板中可以调整体型、身高和识别颜色,重点需要设置“基础姿势”,如果需要人物移动,必须将姿势改为“行走”,否则人物会保持站立姿势在地面平移,看起来像滑行。
设计人物走位的方法很简单:在图层面板选中人物,点击左侧栏的“绘制轨迹”,在地面上按住鼠标拖动即可生成路径,松手后时间轴会自动生成对应的轨道和关键帧。如果在透视视角下容易误选到其他物体,可以先切换到顶视图,并将显示模式改为半透明,就能更精准地绘制地面轨迹。
第四步:设置机位和升降运镜
创建机位的便捷方法是:先手动调整视口到你想要的构图,再点击“从当前视角创建机位”,机位会直接按照当前的构图生成,参数也会匹配真实相机的设置,包括型号、焦距和光圈。
机位属性中有一个“看向”选项,选择人物后相机会自动对准目标,但这只是一次性对准,当相机沿轨迹移动时,朝向不会自动跟随人物转动。如果需要全程锁定人物,需要通过关键帧来设置:在时间轴的“空间轨迹”轨道中间点击菱形按钮插入轨迹点,选中任意关键帧后,右侧会弹出轨迹点面板,可以调整位置、角度和朝向,实现全程锁定主体的效果。
需要注意的是,通过绘制轨迹生成的机位路径是贴地的,只有通过关键帧设置的路径才能支持高度变化。比如宴会厅镜头中需要的从吊灯高度下降穿过大厅的运镜,就需要通过关键帧调整机位的Y轴高度,从9米降到1.8米,反向的升降运镜同理。
第五步:多机位编排分镜
本次测试的15秒宴会厅镜头使用了四个机位和一个人物,人物的路径片段覆盖0到450帧(按照30fps计算,刚好15秒),四个机位的路径片段依次排列在时间轴上:0-120帧、120-255帧、255-360帧、360-450帧,对应四个不同的镜头片段。
第六步:录制白模并生成成片
顶栏的“录制”菜单有两个选项:全局录制是导演视角,当前轨道录制仅输出当前机位的画面,我们需要选择后者。录制过程不消耗积分,15秒的视频大约需要一分钟导出,完成后会自动回到画布中生成视频节点,分辨率为1920×1080、30fps,共450帧。
最后一步是生成成片:右键添加视频节点,将白模录制的视频节点和场景参考图节点分别连接到该节点,选择“全能参考”模式,使用对应的AI视频模型,调整时长和分辨率后即可提交生成。
这里有一个关键的提示词编写经验:必须明确说明两个素材各自的职责。我的写法是:“素材职责:白模视频只提供四段机位的切换时刻、机位的高度变化、镜头的推进与后拉、人物横穿大厅走向楼梯的路线与速度;它的灰白几何体与蓝色人形不保留。图片定义全部美术——水晶吊灯、双层拱廊、大理石旋转楼梯、红毯、金色装饰与暖光。”
如果不明确说明职责,AI模型可能会继承白模的灰白配色风格。我还在提示词中加入了按时间轴分段的镜头说明,以及“保持一致”的约束条件,包括同一个人物、严格对齐镜头切点、使用硬切不要转场等。本次15秒720P的成片消耗了3525积分,是整个流程中唯一需要付费的步骤。
对照实验:白模到底锁住了什么
完整流程跑通后,一条片子的成本仅为一张参考图和十几分钟的编排时间。为了验证白模的实际作用,我在最开始用一个4秒的镜头做了对照实验。
测试场景设定为黄昏的美术馆长廊,有混凝土方柱和落地窗斜阳,人物沿着柱廊纵深奔跑,镜头在侧面平行跟拍。我先在预演台中编排这个镜头并录制白模视频,再连接参考图和提示词生成成片。将白模成片和AI生成的成片并排逐帧对比后发现,人物出现的位置、穿过的柱子、镜头推进的速度完全一致,甚至人物在3秒半左右跑出画面的时序细节也被精准锁定,成片里同样在同一时间点只剩下空柱廊和斜阳。
作为对照的另一组测试,使用了完全相同的参考图和提示词,仅移除了白模视频的引用。生成的成片画质同样在线,光影效果甚至更华丽,但镜头完全由AI模型自主决定:机位贴近人物,呈现大半身特写,人物全程在画面中奔跑,完全没有实现我预设的远景纵深穿柱奔跑和人物出画的效果。
两组成片都达到了质量达标标准,但只有一组实现了意图达标,两者的区别仅在于是否添加了白模引用。参考图和提示词负责定义场景内容和风格,而白模负责定义人和镜头在空间中的运动关系,这部分内容无论用多少文字都很难精准描述,只需要一段白模视频就能轻松解决。
白模带来的核心价值,其实是确定性:你在预演台中编排的镜头和动作,在最终成片里会完全保留。
高难度测试:同场景多机位拍摄
4秒的单机位测试只是下限验证,我还在同一个场景中尝试了多机位拍摄主体运动的视频,共完成了三个案例,开头提到的赛博雨夜天台镜头就是其中之一,另外两个分别是宴会大厅和地下神殿。
宴会大厅的案例就是前文详细介绍的15秒四机位镜头,也是三个案例中对齐效果最好的。四段镜头之间有三个切换点,我将白模和成片逐帧对比后发现,最大的误差不到一帧,即使慢放暂停都很难挑出问题。尤其是第二段的下降穿厅和第四段的升起后拉运镜,这是我认为用文字提示词最难实现的效果,最终都完美还原。
地下神殿的案例设定为圆形下沉竞技场,穹顶破口射下一道光柱,人物从光柱中心走向外侧柱廊,四段镜头分别为高处俯瞰、正面后退跟拍、贴地环绕和柱廊远景,最终的成片效果同样与白模完全匹配。
三个案例全部一次生成,没有因为画质问题重抽过,需要返工的环节都集中在白模录制阶段,而白模录制不消耗积分,重新录制的成本仅为时间。
实操建议:何时适合使用预演台
根据这几天的测试经验,我整理了这套工具的实操使用建议:
适合使用预演台的场景:镜头和人物存在相对运动关系的,比如跟拍、环绕、穿过场景;有明确空间调度要求的,比如人物需要沿特定路线行走、在特定时刻到达指定位置;需要升降运镜的镜头;一条片子需要切换多个机位,且机位之间的空间关系必须成立的。这类镜头的核心内容就是空间关系,用文字提示词很难精准传递。
不需要使用预演台的场景:单镜头的简单动作,比如人物说话、产品特写旋转等,仅用文字提示词加一张参考图就能完成,使用预演台反而会增加不必要的时间成本。
还有一类场景不建议使用预演台:以光影为核心内容的镜头,比如剪影横移、光线扫过等,这类场景AI视频模型本身已经可以做得很好,添加白模反而属于多此一举。
最后总结
其实在四个月前这款工具内测时我就曾关注过,当时我曾许愿希望它能自动分析我上传的视频和口播风格。四个月后推出的预演台功能与我的预期方向不同,最初我还有些落差,但完成这次全面测试后,我认为这个方向其实更贴合创作者的需求。与其追求复杂的自动分析功能,不如先让创作者完全掌控镜头语言,这是一个可以逐步落地的工程解决方案。
回到最开始看到的影视创作博主的分享,那句“这个运镜和原素材完全一样”真正的意义在于,AI生成视频的镜头选择从此不再需要靠运气。即使是没有专业建模基础的创作者,也可以通过一张场景图和二十分钟的编排,完成一个包含四机位、带升降运镜的15秒镜头,再让AI模型按照你的设计完成拍摄。
目前该平台正在开展相关创作活动,使用预演台制作白模即可参与积分瓜分,实际测试成本还能进一步降低。预演台的入口可以在平台画布中通过右键菜单新建获取。

