Viggle AI开源Meridian:几何引导单素材生成可控新视角镜头

Viggle AI开源了一款名为Meridian的几何引导视频生成模型,该模型依托MiniMax-H3架构和VGGT-Ω模块,能够基于单张图像或已有视频生成全新视角的镜头内容。用户可以独立控制摄像机的运动路径与视频的时间节奏,且仅需单张B200 GPU即可完成推理任务。
该模型的官方演示围绕一个核心问题展开:当事件已经被记录下来之后,是否可以重新选择观看的角度、播放的速度以及停留的瞬间?目前已验证的应用场景包括:
- 摩托车越野素材:组合定制化的摄像机运动路径
- 静态芭蕾照片:基于单张图像生成动态镜头运动效果
- NBA扣篮片段:生成新视角并与原始片段自然衔接
- 浆果落水瞬间:实现播放、暂停与继续播放的定制化效果
核心设计思路
Meridian的核心设计思路是将镜头的空间变化与事件的时间变化分开处理。空间维度涵盖环绕运动、推近拉远、横向/上下移动、视线方向调整以及视场角控制;时间维度则包括选择特定片段、停留在某一帧画面,或是在生成前对输入视频进行慢放或快放操作。
二者可以灵活组合,比如围绕暂停的瞬间移动摄像机、跟随慢动作过程拍摄,或是为加速后的片段切换全新观察角度。Bullet Time只是这类组合应用的其中一种场景,并非模型的能力边界。如果需要调整动作速度,建议先对输入视频进行重新定时,再在新的时间轴上规划摄像机路径。
完整处理流程
Meridian的完整处理流程分为三步:
- 构建几何信息:由VGGT-Ω模块从输入视频中估计深度和摄像机位姿,并将选定的帧转换为带有颜色信息的三维点云。
- 渲染新的观察视图:针对每个输出帧指定输入视频中的时间位置和摄像机视角,渲染对应的三维点云,原始画面未覆盖到的区域会以灰色区域呈现。
- 生成完整镜头:Meridian同时接收原始视频和匹配的几何渲染视频,补全未覆盖的区域并细化最终的画面效果。可以简单理解为:先通过几何信息搭建带有空洞的新视角草稿,再通过视频模型将草稿补全为完整的成片。
推理性能表现
Meridian可以在单张B200 GPU上完成推理,在默认配置下的性能表现如下:
| 输出长度 | 镜头生成时间 | 峰值显存 |
|---|---|---|
| 73帧 | 约36秒 | 88GiB |
| 124帧 | 约80秒 | 89GiB |
| 243帧 | 约150秒 | 113GiB |
模型部署与快速推理
用户可以通过以下步骤获取并使用该模型:
1. 下载模型与代码
pip install -U modelscope
modelscope download --model Viggle/Meridian --local_dir ./Meridian
2. 安装依赖
cd Meridian
python -m pip install -r requirements.txt
python -m pip install peft==0.18.0
3. 快速推理示例
# 对连续事件生成轻微的15°环绕镜头
python inference/sample.py --video examples/media/sp_bouldering_hang.mp4 --yaw 15 --sweep --ease --out out/orbit
播放24帧,保持第24帧49个输出帧,同时移动摄像机
python inference/sample.py --video examples/media/sp_bouldering_reach.mp4 --yaw 35 --freeze 24:49 --out out/bullet
运行脚本后,可以在输出目录中对比源视频、几何参考草稿和最终生成的片段。其中out.mp4为最终生成的成片,render.mp4为带有灰色空洞的几何输入草稿。

