文章摘要
2026年7月31日,MiniMax发布新一代多模态生成模型MiniMax H3。它是通用全模态模型,支持多模态统一理解与生成,最高15秒2K视频直出,原生双声道音视频输出。H3视频生成定价低,在视频编辑能力榜单排全球第一。未来几天将开源,适用于多商业场景,有望重塑行业竞争格局。

MiniMax发布新一代多模态生成模型MiniMax H3:全模态统一架构与15秒2K视频生成

2026年7月31日,MiniMax正式发布新一代多模态生成模型MiniMax H3。这是一款通用全模态生成模型,支持对文本、图像、视频和声音的统一理解与生成,可输出原生双声道音视频,最高支持15秒2K分辨率视频直出。H3在Artificial Analysis视频编辑能力榜单中排名全球第一,视频生成定价为0.8元/秒,仅为同类旗舰模型的三分之一。MiniMax同时宣布H3将于未来几天内开源模型权重。

MiniMax H3发布

H1 MiniMax H3:新一代多模态生成模型的技术突破与产业定位

H2 MiniMax H3发布背景:从特化任务到通用全模态智能

2026年7月31日,MiniMax正式发布新一代多模态生成模型MiniMax H3。此次发布标志着MiniMax从“特化任务模型”迈向“通用多模态智能”的重要探索。MiniMax H3不再以图片、视频、声音的生成、编辑和参考等单一任务为边界,而是在多模态上下文中统一理解创作意图,完成更加自然、连贯的生成与表达。

自成立以来,MiniMax坚持文本与多模态模型并行自研,已先后开源三代M系列文本模型。MiniMax H3则是MiniMax推出的首款开源多模态生成模型。此前两代模型(Hailuo 01、02)分别在系统构建与架构效率上完成迭代,MiniMax H3则进一步实现了任务与模态的统一。H3借鉴了文本模型发展过程中已经被验证的方法,包括复杂问题拆解、推理(Reasoning)、上下文扩展(Scaling Context)和Muon优化器等,并将其应用到多模态理解、数据构建和模型训练中。

H2 MiniMax H3的技术架构:统一理解与生成的创新设计

H3 MiniMax H3的核心技术组件

新一代多模态生成模型MiniMax H3的技术架构围绕全模态统一理解与生成展开设计。其核心技术包括Contextual Omni Representation、H3-VAE(变分自编码器)及H3-Omni Transformer等。

在理解层面,MiniMax H3增加了Caption能力,定制了专属模型和全模态理解管线。大部分素材需要消耗100K Token的推理,最终得到平均约4K的Token。这一设计使得MiniMax H3能够在统一的表征空间中对文本、图像、视频和声音进行联合编码与理解。

H3 In-context Regeneration:突破传统超分方案

MiniMax H3的2K视频输出能力并未使用常规超分模块,而是采用了一种被称为In-context Regeneration的创新方案——使用H3基础模型对自己的低分辨率结果进行In-context的重新生成。这一方案能够最大程度地复用MiniMax H3基模已经具备的生成能力,同时还拥有传统超分方案无法靠“猜”还原的信息。

在训练效率方面,MiniMax通过理解与生成异构训练架构提升了训练吞吐近30%。针对视频长度、分辨率和多模态理解与生成负载差异较大的特点,MiniMax在异构训练、负载均衡和GPU利用效率等方面进行了系统优化,在追求模型效果的同时控制训练和推理成本。

H3 高压缩Tokenizer与成本优化

MiniMax H3通过高压缩Tokenizer降低视频生成所需的Token数量,实现了成本优化与效率的提升。这一技术路径直接支撑了H3在定价上的竞争优势——视频生成价格为0.8元/秒(2K分辨率),仅为业内同类旗舰视频模型的三分之一。

H2 MiniMax H3的多模态生成能力全景解析

H3 输入与输出规格

新一代多模态生成模型MiniMax H3支持文本、图片、音频和视频等多种输入形式。根据MiniMax官方API文档,H3的具体规格如下:

规格项 MiniMax H3参数
模型名称 MiniMax-H3
输出分辨率 2K
输出时长 4–15秒(仅整数)
宽高比 支持常见比例或自适应
首/尾帧输入 0、1或2张图片,宽高256-5760px,宽高比2:5–5:2
参考输入 图片≤9张;视频≤3段(每段2-15秒,总时长≤15秒);音频≤3段(须搭配图片或视频输入)
混合输入上限 总计12个文件
提示词长度 ≤7000字符

MiniMax H3支持的输入格式包括:视频(H.264/AVC、H.265/HEVC)、图片(JPG、JPEG、PNG、WEBP、HEIC、HEIF)、音频(WAV、MP3)。

H3 四种生成模式

根据MiniMax官方文档,新一代多模态生成模型MiniMax H3支持四种核心生成模式:

  1. 文本生成视频(Text-to-Video) :仅通过文本描述即可从零生成视频内容。
  2. 首/尾帧图像生成视频(First/Last-Frame Image-to-Video) :通过提示词配合首帧和/或尾帧图像,控制视频的起始或结束画面。
  3. 参考生成(Reference Generation) :通过提示词配合参考图片、视频或音频,参考角色、动作、镜头、风格、声音或剪辑节奏进行生成。
  4. 视频编辑(Video Editing) :基于指令对已有视频进行编辑与修改。

H3 原生双声道音视频输出

MiniMax H3的一大差异化优势在于其原生双声道音频生成能力。目前大多数多模态模型(包括GPT-4o和Gemini)虽能生成音频,但通常仅产出单一音轨。而MiniMax H3的原生双声道技术可实现空间音频输出,这对视频制作、游戏及沉浸式媒体应用至关重要。更为关键的是,MiniMax H3是原生生成视频与音频,而非将不同模态的独立模型拼接在一起。

H2 MiniMax H3的商业应用场景与行业价值

H3 商用级多场景内容生成能力

根据前期邀测反馈,新一代多模态生成模型MiniMax H3具备商用级的多场景内容生成能力。在指令遵循、文字与品牌信息呈现、V2V Motion Transfer(视频到视频动作迁移)等方面表现出色,可实现精准、可控的多模态内容编辑与生成。

V2V Motion Transfer是指将源视频的动作特征精准迁移至目标视频的技术能力,有助于实现可控的多模态内容编辑。这一能力使得MiniMax H3在需要精确控制角色动作和场景转换的商业场景中具有显著优势。

H3 主要应用领域

MiniMax H3广泛适用于以下商业场景:

应用领域 典型场景
广告 品牌宣传片、产品广告、社交媒体短视频
电商 商品展示视频、详情页动态内容
品牌 品牌形象视频、视觉包装
产品设计 产品概念可视化、设计评审素材
UI/UX 界面交互演示、用户体验测试素材
游戏 游戏预告片、角色展示、场景渲染

从现有演示内容来看,MiniMax H3在2K画质下生成的蜥蜴纹理纤毫毕现,棘状鳞片逼真。在游戏UI界面中,人物机甲渲染细腻,玩家与系统的交互响应流畅,从个人场景切换到城市画面的过渡尤为自然。这些能力表明,MiniMax H3在视觉包装和后期特效方面的优势,使其可以切实服务于对画面质量有较高要求的商业制作需求。

H2 MiniMax H3与主流多模态生成模型横向对比

H3 核心竞品对比

为更全面地理解新一代多模态生成模型MiniMax H3的市场定位,以下将其与当前主流多模态生成模型进行横向对比:

对比维度 MiniMax H3 OpenAI GPT-4o Google Gemini Omni Flash ByteDance Seedance 2.0
模型类型 通用全模态生成模型 全模态大语言模型 多模态视频生成模型 多模态视频生成模型
视频生成分辨率 2K 不支持原生视频生成 720p 支持高清
最大视频时长 15秒 3–10秒 支持视频延长
音频输出 原生双声道 单音轨 支持 音视频联合生成
开源策略 即将开源权重 闭源 闭源 闭源
定价(2K视频/秒) 0.8元 0.1美元 未公开

GPT-4o将文本、图像、音频、视频的理解与生成能力深度集成到统一模型架构中,能同时处理多模态输入、生成多模态输出。但GPT-4o并不直接生成视频。Google Gemini Omni Flash是一款高性能多模态模型,可根据文本说明生成3-10秒的720p视频,每秒生成成本为0.1美元。ByteDance Seedance 2.0采用音视频联合生成架构,支持文本、图片、音频、视频四种模态输入混合。

H3 MiniMax H3的差异化优势

相较于上述竞品,新一代多模态生成模型MiniMax H3的差异化优势主要体现在三个方面:

第一,全模态统一架构。 MiniMax H3不再把图片、视频、声音的生成、编辑和参考拆成彼此独立的任务,而是由文本、图像、视频与声音共同构成多模态上下文,统一理解创作意图。这种设计使得H3能够完成更加自然、连贯的生成与表达。

第二,极致性价比。 MiniMax H3的2K视频生成定价为0.8元/秒,不到主流模型的三分之一。在768P分辨率下价格不到主流模型的二分之一。这一价格策略使H3在大规模商业应用中具备显著的成本优势。

第三,开源策略。 MiniMax H3是国产视频生成大模型首次面向社区开放权重的尝试。H3在设计初期就考虑了多款国产芯片的兼容性。开源将使企业可以在本地灵活部署,结合自身数据和业务进行优化。

H2 MiniMax H3的开源战略与生态布局

H3 开源时间与方式

MiniMax宣布,新一代多模态生成模型MiniMax H3将在未来几天内,在符合相关法律法规的前提下开放模型权重。企业届时可在本地灵活部署,结合自身数据和业务进行优化,以更好地满足安全合规要求。

H3 开源的战略意义

MiniMax H3的开源在当前视频生成领域具有重要的战略意义。长期以来,闭源模型一直占据视频生成领域的主导地位,迭代速度和生态开放性落后于大语言模型等领域。MiniMax H3的开源旨在推动开源社区的发展、加速国产芯片适配,以及方便有需要的用户定制自己的版本。

H3在设计初期就考虑了多数现有国产芯片的兼容性。芯片厂商和开发者可以共同参与适配和优化,降低使用成本,扩大应用范围。MiniMax方面表示:“我们会持续推动优秀的文本、多模态模型从过往的封闭服务,走向更加开放、可协作的产业生态。”

通过MiniMax H3,MiniMax希望为更多企业和开发者、创作者降低内容创作的门槛。公司称后续版本将推动与M系列模型能力的融合,并持续提升画面精细度。

H2 MiniMax H3对多模态生成行业的影响与展望

H3 竞争格局的重塑

新一代多模态生成模型MiniMax H3的发布将多模态模型的竞争进一步带向效果、成本、开放性与生态协同的综合维度。在行业头部玩家纷纷收紧供给的背景下,MiniMax以“极致性价比+开源”为切入口,试图在AI视频生成赛道走出一条与参数内卷截然不同的差异化路径。

在Artificial Analysis视频模型榜单中,MiniMax H3在视频编辑能力项排名全球第一。这一排名为H3的技术实力提供了第三方验证。MiniMax H3的发布也直接推动了资本市场的积极反应——港股MiniMax当日开盘涨超20%,一度上涨超14%。

H3 技术演进方向

从技术演进的角度看,MiniMax H3代表了多模态生成模型从“特化任务”走向“通用全模态”的重要趋势。H3不再以图片、视频、声音的生成、编辑和参考等单一任务为边界。围绕不同任务的理解和指令遵循,MiniMax对数据体系进行了多轮迭代,提升了模型面对开放输入和复杂指令时的泛化能力。

MiniMax多模态路线目前已进入模型能力、训练效率、开源生态和行业应用协同推进的新阶段。后续版本将推动与M系列模型能力的融合,并持续提升画面精细度。

H3 行业生态的协同发展

MiniMax H3的发布丰富了模型企业与国产AI芯片软硬件协同生态。通过开源策略,H3有望加速国产芯片在多模态生成领域的适配与应用。企业和开发者可以在本地灵活部署H3,结合自身数据和业务进行优化,更好地满足安全合规要求。

总体而言,新一代多模态生成模型MiniMax H3的发布,不仅在技术层面实现了全模态统一理解与生成的重要突破,更在商业模式上通过极致性价比与开源策略,为多模态生成模型的普及与产业化应用开辟了新的路径。

FAQ

问:MiniMax H3是什么时候发布的?

MiniMax H3于2026年7月31日正式发布。

问:MiniMax H3支持哪些输入模态?

MiniMax H3支持文本、图片、音频和视频四种输入形式,可对多模态上下文进行统一理解。

问:MiniMax H3能生成多长、多清晰的视频?

MiniMax H3最高支持15秒2K分辨率视频直出。

问:MiniMax H3的音频输出有什么特点?

MiniMax H3支持原生双声道音视频输出,可实现空间音频效果,区别于多数竞品的单音轨输出。

问:MiniMax H3的定价是多少?

MiniMax H3的视频生成价格为0.8元/秒(2K分辨率),仅为业内同类旗舰模型的三分之一。

问:MiniMax H3会开源吗?

是的。MiniMax宣布H3将在未来几天内,在符合相关法律法规的前提下开放模型权重。

问:MiniMax H3在行业榜单中的表现如何?

在Artificial Analysis视频模型榜单中,MiniMax H3在视频编辑能力项排名全球第一。

问:MiniMax H3主要适用于哪些场景?

MiniMax H3可广泛应用于广告、品牌、电商、产品设计、UI/UX、游戏等商业场景。

问:MiniMax H3与其他多模态模型的主要区别是什么?

MiniMax H3采用全模态统一架构,支持原生双声道音视频输出,具备2K/15秒视频生成能力,定价仅为同类模型的三分之一,且即将开源。

以上内容不代表本平台立场,仅供读者参考