MiniMax发布新一代多模态生成模型MiniMax H3

MiniMax发布新一代多模态生成模型MiniMax H3:全模态统一架构与15秒2K视频生成
2026年7月31日,MiniMax正式发布新一代多模态生成模型MiniMax H3。这是一款通用全模态生成模型,支持对文本、图像、视频和声音的统一理解与生成,可输出原生双声道音视频,最高支持15秒2K分辨率视频直出。H3在Artificial Analysis视频编辑能力榜单中排名全球第一,视频生成定价为0.8元/秒,仅为同类旗舰模型的三分之一。MiniMax同时宣布H3将于未来几天内开源模型权重。

H1 MiniMax H3:新一代多模态生成模型的技术突破与产业定位
H2 MiniMax H3发布背景:从特化任务到通用全模态智能
2026年7月31日,MiniMax正式发布新一代多模态生成模型MiniMax H3。此次发布标志着MiniMax从“特化任务模型”迈向“通用多模态智能”的重要探索。MiniMax H3不再以图片、视频、声音的生成、编辑和参考等单一任务为边界,而是在多模态上下文中统一理解创作意图,完成更加自然、连贯的生成与表达。
自成立以来,MiniMax坚持文本与多模态模型并行自研,已先后开源三代M系列文本模型。MiniMax H3则是MiniMax推出的首款开源多模态生成模型。此前两代模型(Hailuo 01、02)分别在系统构建与架构效率上完成迭代,MiniMax H3则进一步实现了任务与模态的统一。H3借鉴了文本模型发展过程中已经被验证的方法,包括复杂问题拆解、推理(Reasoning)、上下文扩展(Scaling Context)和Muon优化器等,并将其应用到多模态理解、数据构建和模型训练中。
H2 MiniMax H3的技术架构:统一理解与生成的创新设计
H3 MiniMax H3的核心技术组件
新一代多模态生成模型MiniMax H3的技术架构围绕全模态统一理解与生成展开设计。其核心技术包括Contextual Omni Representation、H3-VAE(变分自编码器)及H3-Omni Transformer等。
在理解层面,MiniMax H3增加了Caption能力,定制了专属模型和全模态理解管线。大部分素材需要消耗100K Token的推理,最终得到平均约4K的Token。这一设计使得MiniMax H3能够在统一的表征空间中对文本、图像、视频和声音进行联合编码与理解。
H3 In-context Regeneration:突破传统超分方案
MiniMax H3的2K视频输出能力并未使用常规超分模块,而是采用了一种被称为In-context Regeneration的创新方案——使用H3基础模型对自己的低分辨率结果进行In-context的重新生成。这一方案能够最大程度地复用MiniMax H3基模已经具备的生成能力,同时还拥有传统超分方案无法靠“猜”还原的信息。
在训练效率方面,MiniMax通过理解与生成异构训练架构提升了训练吞吐近30%。针对视频长度、分辨率和多模态理解与生成负载差异较大的特点,MiniMax在异构训练、负载均衡和GPU利用效率等方面进行了系统优化,在追求模型效果的同时控制训练和推理成本。
H3 高压缩Tokenizer与成本优化
MiniMax H3通过高压缩Tokenizer降低视频生成所需的Token数量,实现了成本优化与效率的提升。这一技术路径直接支撑了H3在定价上的竞争优势——视频生成价格为0.8元/秒(2K分辨率),仅为业内同类旗舰视频模型的三分之一。
H2 MiniMax H3的多模态生成能力全景解析
H3 输入与输出规格
新一代多模态生成模型MiniMax H3支持文本、图片、音频和视频等多种输入形式。根据MiniMax官方API文档,H3的具体规格如下:
| 规格项 | MiniMax H3参数 |
|---|---|
| 模型名称 | MiniMax-H3 |
| 输出分辨率 | 2K |
| 输出时长 | 4–15秒(仅整数) |
| 宽高比 | 支持常见比例或自适应 |
| 首/尾帧输入 | 0、1或2张图片,宽高256-5760px,宽高比2:5–5:2 |
| 参考输入 | 图片≤9张;视频≤3段(每段2-15秒,总时长≤15秒);音频≤3段(须搭配图片或视频输入) |
| 混合输入上限 | 总计12个文件 |
| 提示词长度 | ≤7000字符 |
MiniMax H3支持的输入格式包括:视频(H.264/AVC、H.265/HEVC)、图片(JPG、JPEG、PNG、WEBP、HEIC、HEIF)、音频(WAV、MP3)。
H3 四种生成模式
根据MiniMax官方文档,新一代多模态生成模型MiniMax H3支持四种核心生成模式:
- 文本生成视频(Text-to-Video) :仅通过文本描述即可从零生成视频内容。
- 首/尾帧图像生成视频(First/Last-Frame Image-to-Video) :通过提示词配合首帧和/或尾帧图像,控制视频的起始或结束画面。
- 参考生成(Reference Generation) :通过提示词配合参考图片、视频或音频,参考角色、动作、镜头、风格、声音或剪辑节奏进行生成。
- 视频编辑(Video Editing) :基于指令对已有视频进行编辑与修改。
H3 原生双声道音视频输出
MiniMax H3的一大差异化优势在于其原生双声道音频生成能力。目前大多数多模态模型(包括GPT-4o和Gemini)虽能生成音频,但通常仅产出单一音轨。而MiniMax H3的原生双声道技术可实现空间音频输出,这对视频制作、游戏及沉浸式媒体应用至关重要。更为关键的是,MiniMax H3是原生生成视频与音频,而非将不同模态的独立模型拼接在一起。
H2 MiniMax H3的商业应用场景与行业价值
H3 商用级多场景内容生成能力
根据前期邀测反馈,新一代多模态生成模型MiniMax H3具备商用级的多场景内容生成能力。在指令遵循、文字与品牌信息呈现、V2V Motion Transfer(视频到视频动作迁移)等方面表现出色,可实现精准、可控的多模态内容编辑与生成。
V2V Motion Transfer是指将源视频的动作特征精准迁移至目标视频的技术能力,有助于实现可控的多模态内容编辑。这一能力使得MiniMax H3在需要精确控制角色动作和场景转换的商业场景中具有显著优势。
H3 主要应用领域
MiniMax H3广泛适用于以下商业场景:
| 应用领域 | 典型场景 |
|---|---|
| 广告 | 品牌宣传片、产品广告、社交媒体短视频 |
| 电商 | 商品展示视频、详情页动态内容 |
| 品牌 | 品牌形象视频、视觉包装 |
| 产品设计 | 产品概念可视化、设计评审素材 |
| UI/UX | 界面交互演示、用户体验测试素材 |
| 游戏 | 游戏预告片、角色展示、场景渲染 |
从现有演示内容来看,MiniMax H3在2K画质下生成的蜥蜴纹理纤毫毕现,棘状鳞片逼真。在游戏UI界面中,人物机甲渲染细腻,玩家与系统的交互响应流畅,从个人场景切换到城市画面的过渡尤为自然。这些能力表明,MiniMax H3在视觉包装和后期特效方面的优势,使其可以切实服务于对画面质量有较高要求的商业制作需求。
H2 MiniMax H3与主流多模态生成模型横向对比
H3 核心竞品对比
为更全面地理解新一代多模态生成模型MiniMax H3的市场定位,以下将其与当前主流多模态生成模型进行横向对比:
| 对比维度 | MiniMax H3 | OpenAI GPT-4o | Google Gemini Omni Flash | ByteDance Seedance 2.0 |
|---|---|---|---|---|
| 模型类型 | 通用全模态生成模型 | 全模态大语言模型 | 多模态视频生成模型 | 多模态视频生成模型 |
| 视频生成分辨率 | 2K | 不支持原生视频生成 | 720p | 支持高清 |
| 最大视频时长 | 15秒 | — | 3–10秒 | 支持视频延长 |
| 音频输出 | 原生双声道 | 单音轨 | 支持 | 音视频联合生成 |
| 开源策略 | 即将开源权重 | 闭源 | 闭源 | 闭源 |
| 定价(2K视频/秒) | 0.8元 | — | 0.1美元 | 未公开 |
GPT-4o将文本、图像、音频、视频的理解与生成能力深度集成到统一模型架构中,能同时处理多模态输入、生成多模态输出。但GPT-4o并不直接生成视频。Google Gemini Omni Flash是一款高性能多模态模型,可根据文本说明生成3-10秒的720p视频,每秒生成成本为0.1美元。ByteDance Seedance 2.0采用音视频联合生成架构,支持文本、图片、音频、视频四种模态输入混合。
H3 MiniMax H3的差异化优势
相较于上述竞品,新一代多模态生成模型MiniMax H3的差异化优势主要体现在三个方面:
第一,全模态统一架构。 MiniMax H3不再把图片、视频、声音的生成、编辑和参考拆成彼此独立的任务,而是由文本、图像、视频与声音共同构成多模态上下文,统一理解创作意图。这种设计使得H3能够完成更加自然、连贯的生成与表达。
第二,极致性价比。 MiniMax H3的2K视频生成定价为0.8元/秒,不到主流模型的三分之一。在768P分辨率下价格不到主流模型的二分之一。这一价格策略使H3在大规模商业应用中具备显著的成本优势。
第三,开源策略。 MiniMax H3是国产视频生成大模型首次面向社区开放权重的尝试。H3在设计初期就考虑了多款国产芯片的兼容性。开源将使企业可以在本地灵活部署,结合自身数据和业务进行优化。
H2 MiniMax H3的开源战略与生态布局
H3 开源时间与方式
MiniMax宣布,新一代多模态生成模型MiniMax H3将在未来几天内,在符合相关法律法规的前提下开放模型权重。企业届时可在本地灵活部署,结合自身数据和业务进行优化,以更好地满足安全合规要求。
H3 开源的战略意义
MiniMax H3的开源在当前视频生成领域具有重要的战略意义。长期以来,闭源模型一直占据视频生成领域的主导地位,迭代速度和生态开放性落后于大语言模型等领域。MiniMax H3的开源旨在推动开源社区的发展、加速国产芯片适配,以及方便有需要的用户定制自己的版本。
H3在设计初期就考虑了多数现有国产芯片的兼容性。芯片厂商和开发者可以共同参与适配和优化,降低使用成本,扩大应用范围。MiniMax方面表示:“我们会持续推动优秀的文本、多模态模型从过往的封闭服务,走向更加开放、可协作的产业生态。”
通过MiniMax H3,MiniMax希望为更多企业和开发者、创作者降低内容创作的门槛。公司称后续版本将推动与M系列模型能力的融合,并持续提升画面精细度。
H2 MiniMax H3对多模态生成行业的影响与展望
H3 竞争格局的重塑
新一代多模态生成模型MiniMax H3的发布将多模态模型的竞争进一步带向效果、成本、开放性与生态协同的综合维度。在行业头部玩家纷纷收紧供给的背景下,MiniMax以“极致性价比+开源”为切入口,试图在AI视频生成赛道走出一条与参数内卷截然不同的差异化路径。
在Artificial Analysis视频模型榜单中,MiniMax H3在视频编辑能力项排名全球第一。这一排名为H3的技术实力提供了第三方验证。MiniMax H3的发布也直接推动了资本市场的积极反应——港股MiniMax当日开盘涨超20%,一度上涨超14%。
H3 技术演进方向
从技术演进的角度看,MiniMax H3代表了多模态生成模型从“特化任务”走向“通用全模态”的重要趋势。H3不再以图片、视频、声音的生成、编辑和参考等单一任务为边界。围绕不同任务的理解和指令遵循,MiniMax对数据体系进行了多轮迭代,提升了模型面对开放输入和复杂指令时的泛化能力。
MiniMax多模态路线目前已进入模型能力、训练效率、开源生态和行业应用协同推进的新阶段。后续版本将推动与M系列模型能力的融合,并持续提升画面精细度。
H3 行业生态的协同发展
MiniMax H3的发布丰富了模型企业与国产AI芯片软硬件协同生态。通过开源策略,H3有望加速国产芯片在多模态生成领域的适配与应用。企业和开发者可以在本地灵活部署H3,结合自身数据和业务进行优化,更好地满足安全合规要求。
总体而言,新一代多模态生成模型MiniMax H3的发布,不仅在技术层面实现了全模态统一理解与生成的重要突破,更在商业模式上通过极致性价比与开源策略,为多模态生成模型的普及与产业化应用开辟了新的路径。
FAQ
问:MiniMax H3是什么时候发布的?
MiniMax H3于2026年7月31日正式发布。
问:MiniMax H3支持哪些输入模态?
MiniMax H3支持文本、图片、音频和视频四种输入形式,可对多模态上下文进行统一理解。
问:MiniMax H3能生成多长、多清晰的视频?
MiniMax H3最高支持15秒2K分辨率视频直出。
问:MiniMax H3的音频输出有什么特点?
MiniMax H3支持原生双声道音视频输出,可实现空间音频效果,区别于多数竞品的单音轨输出。
问:MiniMax H3的定价是多少?
MiniMax H3的视频生成价格为0.8元/秒(2K分辨率),仅为业内同类旗舰模型的三分之一。
问:MiniMax H3会开源吗?
是的。MiniMax宣布H3将在未来几天内,在符合相关法律法规的前提下开放模型权重。
问:MiniMax H3在行业榜单中的表现如何?
在Artificial Analysis视频模型榜单中,MiniMax H3在视频编辑能力项排名全球第一。
问:MiniMax H3主要适用于哪些场景?
MiniMax H3可广泛应用于广告、品牌、电商、产品设计、UI/UX、游戏等商业场景。
问:MiniMax H3与其他多模态模型的主要区别是什么?
MiniMax H3采用全模态统一架构,支持原生双声道音视频输出,具备2K/15秒视频生成能力,定价仅为同类模型的三分之一,且即将开源。

