文章摘要
OmniShow是多所高校与企业联合完成的多模态视频生成模型,其设计哲学是“少即是多”。它不堆叠复杂模块,而是吃透基础模型后,以极小改动接入新模态,如视觉处理复用通道拼接机制、音频设计门控局部上下文注意力机制。其还通过异构数据流程与先分后合训练,让模型从专才变通才。实验验证该模型兼顾体量与性能,其设计哲学值得借鉴。

不用堆叠复杂模块,123亿参数的模型就能成为全能多模态视频生成通才。

针对强大的视频生成基础模型拓展新能力,行业常见的思路是“缺啥补啥”:如果需要支持参考图保身份,就额外挂载一套形象保留网络;如果需要支持音频驱动,就再接一套音频控制模块;如果需要姿态控制,就再添加一路姿态分支。但这种堆叠方式会让模型体量越来越臃肿,而且基础模型经过大规模预训练学到的生成先验,会在一次次的结构改造中被稀释、打乱,最终影响生成效果的稳定性。

OmniShow给出了完全相反的解决方案:不去从零搭建新结构,而是先吃透基础模型的原生输入结构与学习动态,再用尽可能小的改动,让多模态条件顺着模型已经熟悉的路径自然接入。这项由多所高校与企业联合完成的工作,已被国际顶级机器学习会议接收,面向的是需要在同一段视频里同时调度文本、参考图像、音频、姿态的多模态可控视频生成新任务。

这类任务的核心难点从来不是单独支持某一种模态,而是让所有模态在时序、空间、语义三个层面都保持协同一致:人物不能换脸,商品不能变形,嘴型要匹配音频节奏,肢体要服从姿态指引,同时画面整体还要忠于文本描述。现有的方案大多存在偏科问题:比如参考图到视频的模型擅长保留参考形象,但无法实现音频驱动的动作;音频驱动的模型能响应声音节奏,但通常只能支持首帧画面,难以同时指定人物与物体的外观;姿态引导的模型可以精确控制动作,但在身份保持与音画同步上表现不佳;还有部分面向交互的方案还需要额外依赖掩码、轨迹、深度、边界框等额外信息,使用门槛极高。

如果把这些子系统硬级联在一起,不仅模型会变得非常笨重,还很容易在模态交界处出现生成崩坏的问题。OmniShow的设计思路正是针对这些痛点:与其拼接多个独立系统,不如让单一模型在端到端的框架里,以最小的代价学会协调所有模态。

极简干预:顺着模型原生路径接入新模态

这一哲学的核心判断是,只要真正理解了扩散模型的原生输入结构与学习动态,就不需要对基础模型进行大改,极小的改动就能实现强大的多模态控制。OmniShow在视觉条件的处理上把这一哲学贯彻得最彻底:参考图像与姿态同属视觉信号,团队没有为它们额外设置独立分支,而是直接复用基础模型原生的通道拼接机制。

首先将姿态渲染为RGB视频再通过VAE编码,参考图像同样经过VAE编码,随后在时间维度上增设伪帧令牌专门承载参考图像信息,姿态则与噪声视频令牌对齐。这样一来,模型接收到的输入形式依旧近似它早已熟悉的原生图像到视频生成任务,因此任务适配的差距被压缩到极小。

为了让参考图像从“被动条件”变成“主动优化目标”,OmniShow还补充了一道极轻的参考重建损失:伪帧令牌不用全零初始化,而是填入同一时间步加噪后的参考图像令牌,并要求模型重建其语义细节。这个改动很小,却把“保持参考图像保真”变成了模型显式追求的优化目标,整套视觉注入的设计思路,与后续的音频模块、训练流程一脉相承,共同构成了OmniShow的完整 pipeline。

音频架构的精细化设计

声音是具有连续节奏与局部时间关系的模态,直接塞进通道并不合适。OmniShow为音频设计了门控局部上下文注意力机制:首先使用Wav2Vec 2.0融合多层音频特征,通过滑动窗口将音频特征对齐到视频帧率,再使用掩码注意力约束每个隐式视频帧只关注对应的局部音频令牌,从而稳定建立逐帧的音画对应关系。

最能体现“极简干预”巧思的是自适应门控机制:新插入的音频注意力如果一开始强度过大,会扰乱预训练模型的特征分布;OmniShow将可学习的门控向量初始化为接近零的值,让音频对模型的影响从极弱处缓慢生长。更关键的是,门控范数反过来成为了诊断工具,可以揭示音频在各个模块的影响强弱,据此判断只需要在双流模块中插入音频注意力即可。

最终,音频模块仅让模型增加约2.5%的参数,整体模型规模维持在123亿参数,换句话说,这套音频架构是通过分析模型动态设计出来的,而不是通过堆叠模块得到的。

从专才到通才:盘活异构训练数据

第二条哲学落在数据与训练流程上。完整的多模态样本极其稀缺——一条合格的样本需要同时满足文本描述、参考图像、音频、姿态与目标视频的质量要求,几乎可遇不可求。OmniShow没有被这个门槛困住,而是构建了多层异构数据流程,整合了参考图到视频、音频到视频、参考图+音频到视频、参考图+音频+姿态到视频等各类数据:从大规模以人为中心的视频数据集出发,先进行镜头分割切分,再按分辨率、美学质量、运动强度、OCR识别结果等维度逐层过滤。

训练采用先分离再联合的策略:首先分别训练参考图到视频与音频到视频两个专才模型,让它们各自掌握参考图像保真与音画同步的能力;随后通过权重插值合并两个模型的参数,音频模块直接继承自音频到视频模型,其余参数按照0.6比0.4的比例融合,这一偏向音频模型的比例,体现了“音画同步对权重扰动更敏感,需要更稳定保留”的设计判断;之后在完整的参考图+音频到视频数据上继续训练,并用高质量子集进一步提纯模型,最后才引入姿态监督信号,避免模型过早依赖强监督而牺牲身份保持与音画同步的能力。

真正动人的发现出现在合并的那一刻:还没有显式训练参考图+音频+姿态的联合任务,合并后的模型就已经涌现出了同时支持参考图像与音频的生成能力,论文将“可控性可以通过权重插值自然涌现”列为了值得深挖的重要启发,这正是“从专才到通才”最直接的证据。

实验验证:兼顾体量与性能

将两个设计哲学结合,理应得到一个既统一又不偏科的模型。为了系统验证这一点,OmniShow构建了HOIVG-Bench评测集:包含135个精选样本,每个样本都配有详细的文本描述、人物与物体参考图像、语义对齐的音频与连贯的姿态序列。评测从文本对齐度、参考图像一致性、姿态精度、音画同步性、视频质量五个维度展开,专门拆解“姿态准确但身份漂移、嘴型匹配但物体变形”这类偏科问题。

定性来看,OmniShow在多种模态组合下都能稳定保持目标形象、生成自然连贯的动作、实现精准的音画同步。定量结果可以分为三种设置来看:在仅支持参考图像的设置下,多项核心指标位居第一,人脸相似度紧追体量更大的同类模型;在支持参考图像+音频的设置下,音画同步与一致性指标全面领先更大体量的对比模型,加入音频后画质与表现同步提升;在支持参考图像+姿态的设置下,动作控制精度明显优于同类方案,整体表现同样保持领先。

而这一切都建立在仅123亿参数、音频模块仅增加约2.5%参数的轻量改动之上,对比同类模型为音频模块大幅增加参数、整体体量翻倍的方案,OmniShow的极简干预思路性价比不言自明。单项能力测试同样经得起检验,在专评音频驱动效果的基准测试上,相关指标同样位居前列,证明“先做强专才模型再纳入统一框架”的思路并没有削弱单项模态的生成能力。

总结:被验证的设计哲学

OmniShow最值得借鉴的,未必只是某个具体的模块设计,而是一套已经被实验系统验证过的设计哲学:面对能力越来越强的基础模型,真正稀缺的往往不是“再加一个新结构”的勇气,而是克制地判断哪些该改、哪些不该改的智慧。

它给出的答案并不激进,却很有力量:先读懂模型原本的输入结构与学习动态,沿着它熟悉的路径去接入新的模态条件,而不是把每一种新需求都变成一次推倒重来的结构改造;再通过异构数据与分阶段训练,把零散的专才能力慢慢熔铸成一个稳定协同的通才系统。这也是为什么OmniShow的“极简干预”不是一种保守妥协,反而更像一种更成熟的模型扩展观:它承认大模型时代最宝贵的资产并不是某个新模块本身,而是基础模型已经学到的生成先验、时序规律与多模态表征能力,与其不断叠加复杂结构去和这些先验能力博弈,不如用最小但精准的介入,让新条件顺势融入已有系统。

少即是多,在这里不是一句审美口号,而是一种能够同时兼顾参数效率、训练稳定性、任务统一性与应用可组合性的工程方法论。

以上内容不代表本平台立场,仅供读者参考