文章摘要
AI视频生成技术迭代快,但精准的精细运动控制是痛点,现有部分方案成本高、通用性差。ICLR 2026收录的论文《Time-to-Move》提出双时钟去噪思路,通过调整采样策略,为现有模型注入精准运动控制能力,且无需重新训练,在多模型验证效果不错。

从早期的文生视频模型到新一代智能生成工具,AI视频生成技术的整体表现一直在快速迭代,但想要实现精准的精细运动控制,始终是行业普遍面临的痛点,不少用户都曾遇到过生成结果与预期运动轨迹不符的问题。

目前市面上的部分运动控制方案,比如基于轨迹、姿态或是相机视角的控制网络,往往需要针对特定模型单独训练运动控制模块,一旦更换生成模型,就需要重新进行训练,不仅成本较高,也限制了技术的通用性。

不过近期一篇收录于国际顶会ICLR 2026的研究论文《Time-to-Move(简称TTM)》提出了全新的思路:无需重新训练专用的运动控制模型,仅通过修改扩散模型的采样过程,就能让现有视频生成工具获得精准的精细运动控制能力。

扩散模型的视频生成逻辑,是基于对整体视频分布的学习,外观、空间结构和运动信息会在统一的生成流程中同步形成。而用户通过文字提示给出的运动约束往往只有语义层面的描述,比如“物体向左移动”,但具体的移动速度、路径细节、镜头跟随方式等,模型拥有相当大的自主选择空间。这也是为什么即便是使用完全相同的文字提示,每次生成的视频运动效果也可能存在差异,核心原因在于用户很难通过纯文字精确传递自己想要的运动细节。

想要解决这个问题,最直观的方式或许不是用冗长的文字描述运动,而是直接通过可视化的方式绘制运动轨迹。比如用户可以直接在初始生成的画面中,拖拽目标物体到想要的目标位置,系统会自动生成包含RGB图像、深度信息和物体掩码的三层表征;再通过深度感知重投影和拖拽修正操作,让物体按照用户指定的轨迹完成移动,从而得到一段粗略的运动视频。这段粗略的视频可能存在空洞、拉伸、遮挡错误或是纹理失真等问题,但它已经完整传递了“物体应该如何运动”的核心信息,论文将这类视频称为“运动草图”——它不需要具备真实的视觉质感,唯一的价值就是提供明确的运动约束。之后再通过预训练的扩散模型,就能将这份运动草图重建为自然流畅的高质量视频。

那么如何让扩散模型在生成过程中,始终遵循运动草图给出的轨迹约束呢?这篇论文的核心创新在于提出了双时钟去噪(Dual Clock Denoising)的思路。

传统的扩散视频生成流程中,所有画面区域都会使用统一的扩散时间步进行去噪,从高噪声状态逐步过渡到清晰的视频帧。但这种统一的处理方式存在一个明显的矛盾:需要保持运动轨迹的物体区域,需要持续接收轨迹约束,不能过早收敛;而背景区域则希望尽快完成去噪,生成稳定的细节内容,两者的诉求并不一致。

TTM的解决方案是为不同的空间区域分配差异化的扩散时间步:研究人员会预先定义两个时间参数,分别是t_strongt_weak,再通过运动掩码区分画面中的运动区域和背景区域,让运动区域使用t_strong时间步进行去噪,背景区域则使用t_weak时间步。这样一来,在同一生成时刻,画面的不同空间位置会处于不同的噪声水平,也就是实现了空间异步扩散。

这项技术的核心逻辑在于,运动草图本身也是通过加噪处理得到的,因此在扩散生成的过程中,需要让画面中的运动区域与运动草图保持同步。如果运动区域的去噪速度过快,轨迹约束会随着去噪完成逐渐失效;而如果背景区域长期保持高噪声状态,生成的视频就会缺乏稳定的细节质感。

双时钟去噪的设计恰好解决了这个矛盾:运动区域保留更多的生成自由度,持续接收运动草图的轨迹约束,确保物体按照预设路径移动;背景区域则可以更快完成去噪,生成清晰稳定的细节内容。最终,这套系统可以同时实现精准的轨迹跟随和自然的视频画质,而且完全不需要重新训练原有模型。

研究团队在多个主流视频生成模型上验证了这套方案的效果,包括Wan2.1、HunyuanVideo、CogVideoX等,双时钟去噪机制在这些模型上都能取得不错的效果。这说明,视频的运动控制能力不一定需要通过额外训练的专用模块来实现,在很多情况下,仅通过调整采样策略,就能为现有模型注入精准的运动控制能力。

从本质上来说,TTM技术改变的是扩散系统在生成过程中“如何组织计算时间与空间依赖关系”,也就是对计算结构进行动态调整,而且这套方案是模型无关的,不依赖特定的视频生成模型。

笔者认为,通过调整推理阶段的计算结构,未来一段时间内将会为AI模型的推理能力带来重要提升:除了像TTM这样实现视频生成的精准运动控制和二次编辑之外,这类技术还可以被用于注入形式化的控制方法,进一步提升模型的指令遵循能力和安全合规性。

近期有行业团队预告了新一代视频生成工具的升级,将支持全模态输入、30秒4K原生直出等能力,同时强化视频的精准二次编辑功能,其背后或许也会用到类似的动态调整生成结构的技术思路。

参考文献:Time-to-Move: Training-Free Motion Controlled Video Generation via Dual-Clock Denoising, https://arxiv.org/abs/2511.08633

以上内容不代表本平台立场,仅供读者参考