文章摘要
Viggle AI开源几何引导视频生成模型Meridian,该模型可基于单张图像或已有视频生成可控新视角镜头,支持独立控制摄像机运动路径与视频时间节奏,单张B200 GPU即可完成推理。它采用时空分离的设计思路,分三步完成处理,已验证多个应用场景,目前已开放代码供用户部署使用。

Viggle AI开源了一款名为Meridian的几何引导视频生成模型,该模型依托MiniMax-H3架构和VGGT-Ω模块,能够基于单张图像或已有视频生成全新视角的镜头内容。用户可以独立控制摄像机的运动路径与视频的时间节奏,且仅需单张B200 GPU即可完成推理任务。

该模型的官方演示围绕一个核心问题展开:当事件已经被记录下来之后,是否可以重新选择观看的角度、播放的速度以及停留的瞬间?目前已验证的应用场景包括:

  • 摩托车越野素材:组合定制化的摄像机运动路径
  • 静态芭蕾照片:基于单张图像生成动态镜头运动效果
  • NBA扣篮片段:生成新视角并与原始片段自然衔接
  • 浆果落水瞬间:实现播放、暂停与继续播放的定制化效果

核心设计思路

Meridian的核心设计思路是将镜头的空间变化与事件的时间变化分开处理。空间维度涵盖环绕运动、推近拉远、横向/上下移动、视线方向调整以及视场角控制;时间维度则包括选择特定片段、停留在某一帧画面,或是在生成前对输入视频进行慢放或快放操作。

二者可以灵活组合,比如围绕暂停的瞬间移动摄像机、跟随慢动作过程拍摄,或是为加速后的片段切换全新观察角度。Bullet Time只是这类组合应用的其中一种场景,并非模型的能力边界。如果需要调整动作速度,建议先对输入视频进行重新定时,再在新的时间轴上规划摄像机路径。

完整处理流程

Meridian的完整处理流程分为三步:

  1. 构建几何信息:由VGGT-Ω模块从输入视频中估计深度和摄像机位姿,并将选定的帧转换为带有颜色信息的三维点云。
  2. 渲染新的观察视图:针对每个输出帧指定输入视频中的时间位置和摄像机视角,渲染对应的三维点云,原始画面未覆盖到的区域会以灰色区域呈现。
  3. 生成完整镜头:Meridian同时接收原始视频和匹配的几何渲染视频,补全未覆盖的区域并细化最终的画面效果。可以简单理解为:先通过几何信息搭建带有空洞的新视角草稿,再通过视频模型将草稿补全为完整的成片。

推理性能表现

Meridian可以在单张B200 GPU上完成推理,在默认配置下的性能表现如下:

输出长度 镜头生成时间 峰值显存
73帧 约36秒 88GiB
124帧 约80秒 89GiB
243帧 约150秒 113GiB

模型部署与快速推理

用户可以通过以下步骤获取并使用该模型:

1. 下载模型与代码

pip install -U modelscope
modelscope download --model Viggle/Meridian --local_dir ./Meridian

2. 安装依赖

cd Meridian
python -m pip install -r requirements.txt
python -m pip install peft==0.18.0

3. 快速推理示例

# 对连续事件生成轻微的15°环绕镜头
python inference/sample.py --video examples/media/sp_bouldering_hang.mp4 --yaw 15 --sweep --ease --out out/orbit

播放24帧,保持第24帧49个输出帧,同时移动摄像机

python inference/sample.py --video examples/media/sp_bouldering_reach.mp4 --yaw 35 --freeze 24:49 --out out/bullet

运行脚本后,可以在输出目录中对比源视频、几何参考草稿和最终生成的片段。其中out.mp4为最终生成的成片,render.mp4为带有灰色空洞的几何输入草稿。

以上内容不代表本平台立场,仅供读者参考