文章摘要
2026年8月3日,MiniMax开源新一代通用多模态生成模型MiniMax H3,支持多模态上下文理解、原生音画同步等。当日,华为昇腾等七家国产芯片厂商,以及AMD、Intel等十六家机构完成适配。H3在视频模型榜单表现优异,价格不到同类三分之一。这标志国产大模型与算力协同走向现实,为后续适配提供范式,有望重塑AI视频生成赛道。

2026年8月3日,MiniMax正式开源新一代通用多模态生成模型MiniMax H3,这不仅是该公司首次开源视频生成旗舰模型,更在开源当日引发了国产算力生态的一次集体亮相。华为昇腾、摩尔线程、沐曦、海光信息、昆仑芯、天数智芯、壁仞科技等七家国产芯片厂商,连同AMD、Intel及Hugging Face、魔搭ModelScope、ComfyUI等开发社区和云推理平台,总计十六家机构在H3开源同日完成了适配支持。MiniMax H3开源并获国产算力适配的这场“Day 0”适配行动,标志着国产大模型与国产算力之间的协同已从理念走向现实。

MiniMax H3开源并获国产算力适配

一、事件全景:开源当日即获全生态响应

1.1 开源公告与市场反应

2026年8月3日,MiniMax正式宣布开源其首款多模态生成模型MiniMax H3。这一消息迅速在人工智能行业内引发广泛关注。H3被定位为一款“通用型全模态生成系统”,能够统一理解由文本、图像、视频和音频构成的多模态上下文,并可生成最高2K分辨率、最长15秒、带有原生立体声音频的视频。

MiniMax H3开源并获国产算力适配的消息公布后,资本市场迅速做出反应。MiniMax相关股价出现显著上涨。与此同时,开源社区和开发者群体对这款模型的到来表现出极高的热情。有评论指出,H3是“行业首个达到商用级水平、同时开放权重的多模态视频基座模型”。在海外创作者群体中,H3的开源同样引发了广泛讨论,众多创作者纷纷下场测试。

1.2 从发布预告到正式开源

事实上,H3的发布早有铺垫。2026年7月31日,MiniMax已在世界人工智能大会预热亮相后正式发布了这款模型,并宣布将在未来几天内开放模型权重。MiniMax在官方博客中明确表示,开源的目的包括“推动开源社区的发展、加速国产芯片适配(H3设计初期就考虑了多款现有国产芯片的兼容性),以及方便有需要的用户定制自己的版本”。

短短数日后,承诺兑现。8月3日,模型权重正式在Hugging Face等平台上线,开发者可直接下载使用。而比模型开源本身更令人瞩目的,是国产算力厂商的集体响应速度——MiniMax H3开源并获国产算力适配在同一天内完成。

二、MiniMax H3:技术架构与核心能力

2.1 全模态统一理解与生成

H3的核心定位是“通用全模态生成模型”。与以往将文生视频、图生视频、主体参考、动作参考、视频编辑拆分成独立模块的做法不同,H3的设计理念是“打破任务的边界”。它在预训练阶段便将图像生成、视频生成、音频生成等各类任务统一建模,用自然语言描述任务关系,而非为每种任务单独训练一个专家模型。

这种设计使H3具备了以下核心能力:

多模态上下文理解:H3能够同时接收文本、图像、视频和音频的混合输入,理解它们之间的复杂关系。例如,用户可以通过自然语言指令“参考视频1的希区柯克镜头运动,让图2中的人物唱歌,歌声参考音频3”,H3便能自主完成全模态的理解与生成。

原生音画同步输出:H3生成的视频自带原生立体声音频,无需后期配音合成。音频输出为32kHz立体声,且不区分人声、音效、音乐,统一联合建模。

2K分辨率与多宽高比支持:H3默认提供2K分辨率(2560×1440)输出,支持21:9、16:9、4:3、1:1、3:4、9:16等多种宽高比。

多语言支持:H3稳定支持11种语言,包括阿拉伯语、中文、英语、法语、德语、意大利语、日语、韩语、葡萄牙语、俄语和西班牙语。

2.2 系统架构:三个模块的分工协作

H3系统由三个核心模块组成:

H3-Context-IR:负责深入理解和提炼用户输入的多模态指令,将其转换为结构化的“上下文中间表示”。这一模块对最终输出质量至关重要,目前通过API提供。

H3-Base:根据上下文中间表示生成768p分辨率的音视频内容。这是此次开源的主体,参数规模为330亿。开发者可直接从Hugging Face下载模型权重。

H3-Regenerate-2K:将768p的生成结果连同原始上下文一并送回模型,以2K分辨率重新生成更高画质的视频。这一模块暂未开源,通过API提供。

2.3 核心技术亮点

Contextual Omni Representation:这是H3投入最大的技术模块。多模态上下文的引入使传统的描述方式被重新定义,不仅要描述目标视频本身,还要描述上下文素材之间、上下文与目标之间的关系。大部分素材需要消耗100K Token的推理,最终压缩为约4K Token的表示。

H3-VAE:这一代彻底重构了前代的tokenizer技术,实现了4倍序列长度压缩,直接降低了训练和推理成本,是支撑原生2K分辨率输出的核心技术。

H3-Omni Transformer:由于多模态上下文的引入,H3的序列长度方差比前代大了3倍。MiniMax采用了理解与生成异构的训练架构,端到端训练吞吐提升近30%。

In-context Regeneration:H3的2K输出没有使用常规的专用超分模块,而是让基模对自己的低分辨率结果进行in-context重新生成,最大限度复用基模的生成能力,同时利用原始多模态上下文信息还原细节。

2.4 性能与定价

在Artificial Analysis视频模型榜单中,H3的视频编辑能力排名全球第一,文生视频、图生视频能力分别位居第二、第三名。在定价方面,H3 2K分辨率视频生成价格为0.8元/秒,不到业内同类旗舰视频模型的三分之一。

三、国产算力适配全景:十六家机构的Day 0行动

3.1 何为“Day 0”适配

“Day 0”适配指的是在模型开源当日即完成从模型架构拆解、核心技术分析到推理框架对接、性能验证的全流程适配工作。MiniMax H3开源并获国产算力适配的核心意义正在于此——不是“事后补课”,而是“同步就绪”。

3.2 国产芯片厂商:七家主力集体亮相

摩尔线程:基于AI训推一体智算卡MTT S5000及MUSA软件栈,率先完成H3的适配与运行。摩尔线程团队仅用3小时便打通了从SGLang-MUSA推理框架到MATE、muDNN高性能算子库的完整适配路径。

沐曦股份:曦云C系列GPU率先完成对H3的Day 0适配。该系列GPU基于沐曦自研核心GPU IP打造,具备高能效比与高通用性。

壁仞科技:基于SGLang推理框架,完成H3在旗舰通用GPU产品壁砺系列上的Day 0适配与调优。

海光信息:同步实现Day 0极速适配,当日完成H3在海光DCU平台的全流程适配、部署与性能验证。

华为昇腾:作为国产算力的重要力量,华为昇腾同样在开源当日完成了H3的适配支持。

昆仑芯:完成H3在昆仑芯平台上的适配。

天数智芯:同步完成H3的适配支持。

3.3 国际芯片厂商

AMD和Intel两大国际芯片厂商也在H3开源同日完成了适配支持。这表明MiniMax H3开源并获国产算力适配的影响力不仅局限于国产算力生态,也引起了国际主流硬件厂商的重视。

3.4 开源社区与推理框架

在开源社区方面,Hugging Face、魔搭ModelScope、ComfyUI、RunningHub、fal等平台均在开源当日完成了相关适配支持。在推理框架方面,vLLM-Omni、SGLang等主流框架同步完成适配。H3-Base目前支持通过SGLang、vLLM、diffusers和ComfyUI等框架进行部署。

四、国产算力适配横向对比

适配方 类型 具体平台/产品 适配特点
摩尔线程 国产芯片 AI训推一体智算卡MTT S5000 + MUSA软件栈 3小时打通SGLang-MUSA到MATE、muDNN完整路径
沐曦股份 国产芯片 曦云C系列GPU 自研核心GPU IP,高能效比与高通用性
壁仞科技 国产芯片 壁砺系列旗舰通用GPU 基于SGLang推理框架完成Day0调优
海光信息 国产芯片 海光DCU平台 全流程适配、部署与性能验证
华为昇腾 国产芯片 昇腾系列 开源当日完成适配支持
昆仑芯 国产芯片 昆仑芯平台 开源当日完成适配支持
天数智芯 国产芯片 天数智芯平台 开源当日完成适配支持
AMD 国际芯片 AMD GPU 开源当日完成适配支持
Intel 国际芯片 Intel GPU 开源当日完成适配支持
Hugging Face 开源社区 模型托管平台 开发者可直接下载模型权重
魔搭ModelScope 开源社区 模型托管平台 开源当日完成适配支持
ComfyUI 开源社区 推理工作流平台 支持H3-Base部署
vLLM-Omni 推理框架 推理框架 开源当日完成适配支持
SGLang 推理框架 推理框架 多家芯片厂商基于此框架完成适配

五、行业影响与战略意义

5.1 国产算力生态的历史性突破

MiniMax H3开源并获国产算力适配的意义,远不止于一个模型的成功部署。在此之前,国产大模型与国产算力之间的适配往往存在时间差——模型发布后需要数周甚至数月才能完成对国产芯片的适配优化。而H3在开源当日即获得七家国产芯片厂商的同步适配,这标志着国产算力生态的成熟度已提升至一个新高度。

MiniMax在设计H3之初就将“加速国产芯片适配”列为核心目标之一,在模型设计初期就考虑了对多款现有国产芯片的兼容性。这种“从设计源头兼容国产算力”的思路,为后续更多国产大模型的开源与适配提供了可复用的范式。

5.2 开源战略的双重价值

H3是MiniMax推出的首款开源多模态生成模型。长期以来,闭源模型一直占据视频生成领域的主导地位,迭代速度和生态开放性落后于大语言模型等领域。H3的开源选择打破了这一格局。

从行业角度看,开源带来的价值体现在多个层面:企业可获得部署、数据与工作流的完全控制权;私有化部署后可在企业内部完成素材资产的创建和调用;视频模型具备了被定制和扩展的可能。有分析指出,如果第三方能够复现H3的能力,其开源“就不只是一场社区事件,还可能成为一次产业事件”。

5.3 对AI视频生成赛道的重塑

在H3开源之前,视频生成领域长期由闭源旗舰模型主导。H3以不到主流模型三分之一的价格、开源权重的方式进入市场,在保持顶尖性能的同时大幅降低了使用门槛。

MiniMax H3开源并获国产算力适配的完整生态布局,使其不仅是一个技术产品,更是一个产业基础设施。东方证券研报指出,H3的开源“让视频模型具备被定制和扩展的可能,有更好的定制能力和开发者生态,从而加速AI视频行业整体渗透”。

六、FAQ

问:MiniMax H3是什么?

答:MiniMax H3是MiniMax于2026年8月3日开源的新一代通用多模态生成模型,能够统一理解文本、图像、视频和音频构成的多模态上下文,生成最高2K分辨率、最长15秒、带有原生立体声音频的视频。

问:MiniMax H3开源并获国产算力适配具体指什么?

答:指H3在开源当日即获得华为昇腾、摩尔线程、沐曦、海光信息、昆仑芯、天数智芯、壁仞科技等七家国产芯片厂商,以及AMD、Intel、Hugging Face、魔搭ModelScope等十六家机构的同步适配支持。

问:哪些国产芯片厂商完成了H3的Day 0适配?

答:包括摩尔线程(基于MTT S5000及MUSA软件栈)、沐曦股份(曦云C系列GPU)、壁仞科技(壁砺系列GPU)、海光信息(海光DCU平台)、华为昇腾、昆仑芯、天数智芯。

问:H3的技术架构有何特点?

答:H3由H3-Context-IR、H3-Base、H3-Regenerate-2K三个模块组成。核心技术包括Contextual Omni Representation、H3-VAE、H3-Omni Transformer和In-context Regeneration。H3-Base采用330亿参数的H3-Omni-Transformer架构。

问:H3的性能表现如何?

答:在Artificial Analysis视频模型榜单中,H3的视频编辑能力排名全球第一,文生视频、图生视频能力分别位居第二、第三名。

问:H3的定价是多少?

答:H3 2K分辨率视频生成价格为0.8元/秒,不到业内同类旗舰视频模型的三分之一。

问:开发者如何获取和使用H3?

答:开发者可直接从Hugging Face下载MiniMax H3模型权重。H3-Base支持通过SGLang、vLLM、diffusers和ComfyUI等推理框架进行部署。模型基于MiniMax H3 Community License发布。

问:H3支持哪些输入和输出规格?

答:输出时长4-15秒,支持21:9、16:9、4:3、1:1、3:4、9:16等多种宽高比,输出帧率24 FPS,音频32kHz立体声。输入支持最多9张图像、最多3段视频、最多3段音频,混合输入合计最多12个文件。

以上内容不代表本平台立场,仅供读者参考