文章摘要
清华系Sand.ai开源千亿参数视频模型MAGI - 2 - preview,将MoE架构用于视频生成。该模型总参数量达1140亿,单次推理仅激活约60亿参数,成本是行业主流的十分之一,在AA榜单排名第六。其通过协同优化多方面跑通Scaling系统,开源对学术和企业意义重大,也将重定义行业竞争维度。

任何领先的AI模型,都需要落地到真实行业场景中接受检验,才算真正完成了从实验室到市场的跨越。

近期,一支来自清华的技术团队推出了一款颠覆行业的视频生成模型,再次展现了顶尖技术实力。

他们首次将MoE混合专家架构应用到千亿级参数的视频生成模型中,并且完全开源了所有代码与模型权重。

这款模型发布后迅速在全球科技圈内引发关注,如此规模的模型选择完全开源,实属罕见。

从近期爆火的AI漫剧到专业级长镜头视频,这款模型都能轻松驾驭:不仅声画同步精准,人物动作自然流畅,运镜和对焦的专业度甚至可以媲美闭源第一梯队的商业产品,在商业场景中也能稳定输出高质量内容。

这款由Sand.ai推出的最新作品,名为MAGI-2-preview,继初代Magi-1之后,再次将开源视频生成模型的性能推向新高度。

该模型总参数量达到1140亿,单次前向推理仅激活约60亿参数。以当前8卡H100的算力成本计算,生成一段10秒1080P的视频仅需5毛钱左右,成本仅为行业主流模型的十分之一。

在AA视频生成榜单中,MAGI-2-preview排名第六,仅用60亿激活参数就已经接近闭源模型第一梯队的表现。

这一突破直击当前视频生成模型规模化升级的核心痛点。做大语言模型时,只需要堆叠参数、增加算力就能获得性能提升,但视频生成模型面对的是完整的动态视觉世界,处理难度远超文本模型。

每一帧画面都需要拆分为大量空间像素块,连续帧还要记录人物动作、物体关系和镜头变化,如果再叠加文本描述和音频信息,序列长度会呈指数级增长。如果继续使用稠密模型架构,训练和推理成本将高到难以承受。

想要同时实现模型规模扩大、支持更长视频生成、控制成本在合理范围内,这三者几乎是视频生成领域的「不可能三角」。

针对这一难题,MoE架构提供了可行的思路:通过将模型总容量和单次计算量解耦,让模型可以拥有千亿级的总参数量,但每次推理只激活其中一小部分,从而控制成本。

但视频场景下的MoE架构面临两大核心挑战:首先是通信成本,传统的专家并行模式需要先为token选择Top-K专家,再将数据发送到对应的GPU设备,激活的专家越多,需要传输的数据量就越大。对于本身就需要处理超长序列的视频模型来说,通信成本很容易超过专家计算本身的开销。

其次是训练稳定性,动态变化的路由机制、波动的专家负载,加上多模态数据的复杂处理,都会让大语言模型Scaling过程中已经存在的问题被成倍放大。因此,视频生成的规模化路径,和大语言模型并不完全相同。

简单迁移现有的MoE架构无法解决视频场景的痛点,需要同时应对超长序列、跨卡通信问题,还要保证文本、视频、音频在同一套系统中顺畅协作,这意味着需要从底层开始重新架构整个系统。

目前行业中很少有团队能做到这一点,而Sand.ai是首个将视频MoE架构从理论落地到千亿级参数视频模型的团队。

视频生成的规模化路径不能照搬大语言模型逻辑

想要跑通这套系统,架构设计、底层系统缺一不可。

首先是基础架构的选择,MAGI-2-preview延续了Sand.ai在daVinci-MagiHuman中验证过的单流架构:将文本、视频和音频输入送入同一个Transformer模型,在每一层自注意力机制中直接实现多模态信息交换。

传统的多模态模型通常会将视频、音频分开处理,最后通过交叉注意力机制进行拼接,而MAGI-2-preview从第一层开始就实现了画面和声音的共同建模,这让模型能够更好地处理细微的音画对应关系,同时统一的主干架构也比串联模型的延迟更低、维护成本更少,天然更适配MoE扩展。

在专家设计上,MAGI-2-preview采用了Multi-Head LatentMoE的思路,将3072维的隐藏表示拆分为12个256维的head,每个head独立进行路由选择。同一个token会被分配到多个低维子空间中,不同的head分别专注于不同的任务:有的负责处理人物外观细节,有的专注于动作时序变化,实现了更精细的分工。

在36层的主体网络中,每层总共包含3072个独立专家单元,每个token在每个head内选择6个专家,合计激活72个小专家。虽然看起来同时调用的专家数量变多,但每个专家处理的子空间尺寸更小、分工更明确,让模型能够组合出更多的能力组合。作为对比,主流的MoE大模型如DeepSeek-V4-Pro的每层专家数大多停留在数百级别,而MAGI-2-preview直接将这一数字提升到了三千级。

如此精细的专家架构,离不开完整的自研基础设施。Sand.ai开发了MagiMoE kernel库,将路由、排序、专家计算的整个链路整合在一起,减少了中间结果的显存搬运开销。同时针对Multi-Head MoE的计算模式,对前向和反向传播过程都进行了专门优化。

并行策略也进行了重新设计:Head Parallel模式在路由计算之前就按照head将计算分配到不同设备,设备之间传输的是形状固定的head表示,而非路由后数量动态变化的专家token,这样通信量不会随着激活专家数量的变化而波动,解决了视频长序列带来的通信瓶颈问题。

优化器同样采用了混合设计:矩阵参数使用Muon优化器,专家参数使用AdamW优化器,针对不同性质的参数采用不同的更新节奏,进一步提升了训练稳定性。

最后一环是数据处理。很多团队在构建数据集时会层层过滤,最终得到一个干净但范围狭窄的数据集,但生成模型恰恰需要丰富的多样性,训练数据覆盖的场景越多,生成的内容才越逼真。

MAGI-2-preview采用了从「删减」到「组织」的数据集策略:先扩大有效数据的规模,尽可能保留数据的广度,再通过精准的标注将数据系统化组织,让模型逐步学习不同场景、动作、声音之间的对应关系。同时预训练和后训练的分工也发生了变化:预训练阶段负责覆盖尽可能全面的数据分布,让基础模型学习到通用的视觉和语言知识,后训练阶段则专注于偏好对齐、可控性、安全性和产品适配等细分任务。

通过协同优化模型结构、通信机制、底层基础设施和数据体系,MAGI-2-preview成功跑通了一整套千亿级视频模型的Scaling系统。在扩大总参数量的同时,将单次激活参数控制在可落地的范围内。需要说明的是,60亿激活参数并不等同于60亿稠密模型的实际成本,专家通信、路由机制、显存占用和部署方式都会带来额外开销,但作为一款开源的千亿级视频生成模型,其表现已经达到了行业顶尖水平。

开源的价值远超技术展示

过去开源的视频生成模型大多停留在百亿参数级别,千亿级参数的开源模型将彻底改变整个行业的竞争规则。

对于学术研究者来说,这是首次能够直接解剖千亿级视频MoE模型的机会。专家如何分工、路由机制是否稳定、通信如何优化、规模化的规律能否复现,这些长期以来停留在论文中的问题,终于有了公开的研究对象,这对于学术界和中小研究团队来说,都是一次实实在在的基础设施升级。

对于企业用户来说,开源意味着多了一个私有化部署和行业微调的选择。尤其是金融、医疗、工业等对数据安全性要求极高的行业,数据能否保留在本地、模型能否针对自身业务进行定制训练,其重要性并不亚于生成效果本身。

如果将视野放大到整个行业,开源和闭源的竞争维度也将被重新定义。过去的竞争主要集中在生成效果和成本,未来模型是否支持二次训练、接口是否被单一平台控制,都将成为重要的对比指标。一旦开源模型的性能持续逼近闭源模型,视频生成领域大概率会走上大语言模型的发展路径:闭源厂商依靠产品体验和服务稳定性抢占市场,开源团队则凭借部署灵活性、数据控制权和开发者生态构建优势,两条路线将在更多层面展开正面竞争。

这一系列突破背后,是Sand.ai团队一贯的非共识技术路线。从自回归视频生成,到音画同步建模,再到千亿级MoE开源模型,团队选择的道路往往鲜有人涉足。

这种技术选择和团队背景密切相关:Sand.ai的创始人曹越是清华大学特等奖学金获得者、Swin Transformer的共同一作,曾联合创办光年之外,也曾在智源研究院负责多模态与视觉研究。团队其他成员也都来自顶尖技术机构,这种技术基因让团队更愿意将资源投入到基础模型和底层基础设施的研发中,更关注模型的本质问题,而非追逐短期热点。

创新工场董事长李开复也曾公开推荐该团队,称其为「AI视频生成界的DeepSeek」。这一次,Sand.ai更加激进:首次将千亿级参数、MoE架构和开放权重三者结合,并用一套完整的自研系统让模型真正落地。

这不仅仅是一场技术发布,更是Sand.ai团队对「视频生成模型应该如何发展」这一问题的明确表态。诚然,MAGI-2-preview还不是视频生成领域的最终答案,正式版本还有待进一步完善,但它已经用实践证明:千亿级MoE架构并非大语言模型的专属,同样可以在视频生成领域大放异彩。

团队也欢迎行业内外通过开源代码共同验证这一技术路线,开源地址:
https://github.com/SandAI-org/MAGI-2-preview

以上内容不代表本平台立场,仅供读者参考