H3:从专用到通用的多模态生成模型新范式

我们正式推出了通用全模态生成模型MiniMax H3,这款模型能够统一理解文本、图像、视频、声音组成的多模态上下文,支持输出原生双声道音视频,最高可生成15秒的2K分辨率内容。
根据前期邀测反馈,H3具备商用级多场景内容生成能力,在指令遵循、文字与品牌信息呈现、视频到视频动作迁移等维度表现出色,能够实现精准可控的多模态内容编辑与生成,广泛适配广告、品牌营销、电商运营、产品设计、UI/UX设计、游戏开发等商业场景。
依托Contextual Omni Representation、H3-VAE、H3-Omni Transformer、In-context Regeneration等多项核心技术,H3拥有行业领先的性价比优势。默认提供2K分辨率输出,该分辨率下单秒使用成本不到主流模型的1/3,768P分辨率下的成本也仅为主流产品的1/2左右。
长期以来,闭源模型占据视频生成领域的主导地位,其迭代速度与生态开放性都落后于大语言模型等赛道。为推动开源社区发展、加速国产芯片适配(H3在设计初期就兼顾了多款现有国产芯片的兼容性),同时方便有需求的用户定制专属版本,我们计划在未来数日内,在符合相关法律法规的前提下开放模型权重。
打破任务边界的设计理念
我们此前已经研发了两代模型:Hailuo 01完成了从0到1的系统搭建,Hailuo 02则专注于架构效率、数据质量与模型规模等核心组件的优化。在H3的设计过程中,我们意识到过往生成模型存在明显的任务局限性:图像生成往往被拆分为文生图、图像编辑、主体参考、动作参考、风格参考等独立的专家模型;音频生成中的人声、音效、音乐也多作为独立领域分别研究;视频生成更是细分为文生视频、图生视频、首尾帧处理、主体参考、动作迁移、音色参考、视频编辑等多个细分功能,图像、视频、音频之间也存在清晰的能力边界。
这些任务、能力与模态的隔离限制了使用自由度,也从训练范式上限定了模型的泛化能力,这两点对应着应用范式和训练范式的巨大变革空间。因此,H3构建过程的第一纲领,即是实现任务的统一与泛化。
基于这一思路,我们可以简要概括H3的预训练范式:
- 数据与任务覆盖
- 文生图任务
- 文生视频:支持联合音频生成,所有输出音频均为原生双声道模式,同时原生支持多镜头建模
- 文生音频:不区分人声、音效、音乐,实现统一联合建模
- 广义参考与编辑:支持图片到图片、图片到视频、音频到音频、音视频到音视频的参考与编辑。我们对广义参考与编辑的定义包括两点:一是完全基于真实自然数据构建,具备良好的数据扩展性;二是通过自然语言描述参考与编辑关系,不局限于有限的固定任务,语言作为泛化的桥梁,能够连接各类创作需求。
- 简洁高效的架构选择:我们选择尽可能简洁、通用且高效的架构,所有设计都以服务任务泛化为核心目标。
- 早融合的训练策略:在训练过程中尽可能早地融合各类数据与任务,找到合适的任务配比是提升模型能力的关键。
这些设计选择最终指向一个核心目标:让H3在预训练阶段就具备广泛的多模态上下文理解与生成能力。随着多模态理解、指令遵循与复杂任务执行能力的不断提升,视频模型将能够理解更完整的创作意图,处理更复杂的内容需求,逐步从“生成一段视频”转向真正参与到内容生产的全流程中。
核心技术细节
以下是H3的几项核心技术选型:
- Contextual Omni Representation(上下文全量表征)
在H3的训练工程中,我们最重要的工作之一是增强模型的Caption能力。多模态上下文的引入让Caption的定义得到了进一步泛化:我们不仅需要描述目标视频本身,还需要描述上下文与目标视频的关联关系,甚至是上下文内部元素之间的联系。同时我们需要联合描述视频与音频,而多镜头下的音视频关联则更加复杂。这本质上就是一种Contextual Omni Representation,语言在这里起到了可泛化的连接与解释作用,让“任务”可以通过开放描述的形式实现统一,这也是H3具备广泛指令理解能力的核心根源。为了实现这一目标,我们定制了专属的模型与全模态理解管线,大部分素材需要消耗100K Token进行推理,最终得到平均约4K的Token用于训练。
- H3-VAE:架构效率的大幅优化
H系列模型始终在Tokenizer技术上保持持续探索。H3彻底革新了前代的Tokenizer技术,在重建效果与易学性上实现了全面提升,让H3在效率上具备了竞争优势。其高压缩率带来了4倍的序列长度收益,大幅降低了训练与推理成本,这也是我们能够原生支持2K分辨率输出的关键技术。
- H3-Omni Transformer:面向任务泛化的架构选择
基于H3“架构应服务于任务”的设计理念,通用与高效是仅有的两个核心目标。我们放弃了此前为我们带来显著架构优势的Hailuo-02架构,因为该架构在以任务泛化为核心的模型定义中会带来额外的复杂性,我们坚信“任务泛化”是不可逆转的趋势,架构技巧应当为模型的核心定义让路。在H3中,由于多模态上下文的引入,序列长度的方差扩大了3倍,理解与生成部分的计算 workload也开始出现显著的异质性。我们采用了理解与生成异构的训练架构,精细调优不同 workload下的硬件利用率,同时兼顾单样本异构计算与样本间的负载均衡,最终端到端提升了近30%的训练吞吐。
- In-context Regeneration(上下文内再生)
针对H3的2K分辨率输出,我们没有选择常规的专用超分模块,而是利用H3基模对自身生成的低分辨率结果进行in-context重新生成。这种方式带来了两方面的优势:一是再生过程可以最大程度复用H3基模已具备的生成能力;二是in-context的形式可以再次利用原有的多模态上下文信息进行高分辨率输出,能够还原传统超分方案仅靠“猜测”无法还原的细节,比如小文字与精细画面元素。In-context Regeneration本身也是任务泛化的一种体现。
后续我们将发布更详细的H3技术报告,欢迎各界同仁交流探讨。
模型核心特色
- 统一多模态上下文理解:创作者可以通过自然语言描述完整创作需求,比如“参考视频1的希区柯克镜头运动,让图2中的人物唱歌,歌声参考音频3”,复杂的全模态理解工作将由H3自动完成。
- 原生2K分辨率输出:默认提供2K分辨率生成能力,同时通过自研技术实现了高效的成本控制。
- 原生双声道音视频:所有音频输出均为原生双声道模式,为创作者提供专业的音视频一体化生成服务。
典型应用场景
H3的商用适配场景十分广泛,覆盖了多个内容创作领域:
- 电影片头与宣传片制作
- 游戏UI与剧情动画设计
- 品牌动态海报与宣传物料生成
- 电商广告与产品展示视频制作
未来展望与改进方向
目前H3仍存在一些局限性,我们后续版本的优化方向包括:
- 多模态上下文理解能力是生成能力的核心基础,这里存在巨大的提升空间,我们将推动H系列下一代模型与M系列模型的能力融合;
- 当前的模型规模限制了H3在部分能力上的完成度,扩展模型规模是明确的优化方向,我们相信任务泛化能够为模型扩展带来充分的发挥空间;
- H3在部分场景下的画面精细度仍有待提升,我们将持续追求更高的分辨率与更精细的画面表现。
Intelligence with Everyone.

