MiniMax H3多模态生成模型:2K工作流与部署指南

我们正式推出了全新的通用多模态视频生成模型MiniMax H3并完成开源,这一系统能够实现文本、图像、视频、音频的统一理解与生成,支持最高2K分辨率、最长15秒且带有原生立体声的视频内容。依托任务泛化导向的底层设计,该模型在预训练阶段就已积累了丰富的多模态上下文理解与生成能力,可以精准遵循复杂的多模态生成指令。
该模型支持以下完整的输入输出规格:
- 生成时长:范围在4秒到15秒之间
- 宽高比适配:覆盖21:9、16:9、4:3、1:1、3:4、9:16等多种主流比例
- 分辨率支持:默认生成短边为768像素的内容,通过H3-Regenerate-2K模块可实现2K分辨率的高清生成
- 帧率标准:统一采用24 FPS的流畅帧率
- 音频规格:输出32 kHz的立体声音轨
- 语言支持:可稳定支持阿拉伯语、中文、英语、法语、德语、意大利语、日语、韩语、葡萄牙语、俄语、西班牙语共11种语言,对其他语言也提供了不同程度的兼容性
针对不同的使用场景,H3提供了两个核心版本:
1. H3-Base-FL2VA:首尾帧输入模式
该模式支持输入0、1或2张图像,具体对应不同的生成场景:
- 无图像输入时,实现纯文本生成视频(文生视频)
- 仅输入首帧图像时,可基于首帧完成视频生成
- 仅输入尾帧图像时,可基于尾帧完成视频生成
- 同时输入首尾帧时,实现首尾帧约束的视频生成
2. H3-Base-Ref2VA:全模态参考模式
该模式支持多类型参考输入,具体限制如下:
- 图像参考:最多可输入9张参考图像
- 视频参考:最多3段参考视频,单段时长2-15秒,总时长不超过15秒
- 音频参考:最多3段参考音频,且必须与图像或视频搭配输入,不可单独使用,单段时长2-15秒,总时长不超过15秒
- 混合输入限制:所有类型的输入文件总数最多不超过12个
完整的H3系统由三个核心模块组成:
- H3-Context-IR:作为预处理编排系统,专为自由形式的多模态输入设计,能够解析文本、图像、音频与参考视频之间的关联,以及这些素材与目标生成结果的关系。其内部工作流涵盖指令解析、跨模态关联、时序理解与复杂逻辑推理,最终会将上下文理解结果序列化为H3-Base可直接使用的结构化表示,还可在不偏离用户意图的前提下补充缺失的语义细节。由于该模块依赖多阶段工作流与多个托管模型服务,本次开源暂未包含该模块,官方提供了API帮助用户复现官方工作流,同时也提供了详细的提示词指南,供开发者搭建自定义的上下文处理系统。
- H3-Base:基于H3-Context-IR的结构化输出,完成音频与视频的生成,输出默认分辨率为768p的内容。
- H3-Regenerate-2K:将H3-Base生成的768p结果与原始上下文一同输入模型,实现2K分辨率的重新生成。该方法既复用了H3-Base的生成能力,又能利用原始上下文还原超分辨率模块无法通过猜测得到的细节信息,比如小型文字与精细画面细节。目前该模块暂未开源,官方正在推进相关开源准备工作,后续将第一时间开放,同时提供了API用于复现完整的生成结果。
在安全防护机制上,用户提交的文本、图像和视频,以及经过增强的Prompt,均会接受自动化内容审核。涉嫌违法、色情或侵犯第三方权利的内容可能会被拦截。团队采用行业标准的过滤措施,但无法完全避免误判或漏判。上述安全防护机制不影响被许可方在MiniMax H3 Community License下应承担的义务,尤其是与合法使用和使用限制相关的义务。
H3-Context-IR是一套托管式的预处理与编排系统,面向自由形态的多模态输入打造。它可以精准理解文本、图像、音频与参考视频之间的逻辑关系,以及这些素材与最终生成内容的匹配关系。内部通过指令解析、跨模态关联、时序理解和复杂逻辑推理等步骤,将用户的原始输入转化为H3-Base能够直接识别的结构化上下文表示,同时可在符合用户意图的前提下补充描述不够充分的语义细节。由于该模块依赖多阶段工作流与多个托管模型服务,本次开源版本并未包含该模块,官方提供了专用API帮助用户复现官方工作流的行为,同时配套了详细的提示词写作指南,供开发者自行构建上下文处理系统。
H3-Base是模型的核心生成模块,其架构设计如下:
架构概览:H3-Base针对不同模态使用对应的编码器或VAE进行特征编码,将编码后的特征整合为统一的打包多模态序列,通过RoPE位置编码表达token之间的空间与时间关系,再将完整序列输入H3-Omni-Transformer。其中,文本由H3-Encoder单独编码,视觉输入同时通过H3-Encoder和H3-VisualVAE编码,音频则仅通过H3-AudioVAE编码。H3-Omni-Transformer会联合预测视频latent与音频latent,再分别解码为完整的视频与立体声音频。为降低长多模态序列的计算开销,H3原生支持稀疏注意力训练与推理,首个开源版本仅提供全注意力推理模式,稀疏注意力的实现将在后续更新中开放。
H3-Encoder:该模块采用Qwen3-VL-32B的完整预训练权重,将模型第50层的隐藏状态作为输出提供给H3-Omni-Transformer。开发者在使用H3时,需要采用模型仓库中提供的专属tokenizer与相关配置文件,该tokenizer中新增了如`<d>`等特殊标记以适配模型需求。
H3-VAE:H3分别使用独立的视觉latent与音频latent来表征对应模态:
H3-VisualVAE:这是一个采用时间因果结构的视频自编码器,空间压缩倍率为16倍,时间压缩倍率为4倍,latent通道数为24(记作`f16t4d24`)。团队通过多种latent空间优化技术,同时提升了重建质量与latent的可学习性。在输入H3-Omni-Transformer前,视觉latent会按照时间、高度、宽度三个维度,以`1×2×2`的patch size进行进一步分块,使得进入Transformer的视觉token等效拥有32倍的空间下采样倍率,时间下采样倍率仍保持为4倍。此外,团队在完成encoder训练后,还额外训练了基于ViT的decoder以降低解码成本并进一步提升重建质量。
H3-AudioVAE:该模块使用独立的编码器与解码器分别处理左右音频声道,再将解码后的声道重新组合,实现立体声音频的输入与输出。对于每个声道,H3-AudioVAE会将32 kHz的原始音频压缩为时间频率为40 Hz的latent token序列。团队参考VA-VAE的设计思路对latent空间进行优化,在保持音频重建质量的同时,降低了生成模型的学习难度。
H3-Omni-Transformer:为实现良好的可扩展性与泛化能力,该模块采用了简洁的Transformer block设计,整体为拥有33B参数的密集单流Transformer,其中约13B参数位于与AdaLN相关的分支中。由于AdaLN的调制输出可以预先计算并缓存,在仅用于推理的部署场景中,无需加载这部分参数,团队已发布完整的模型权重以支持包括微调在内的后续开发。该模块的attention层与FFN层均不包含模态专属结构,与模态相关的参数仅存在于输入/输出层与AdaLN分支中,模态专属的AdaLN可以在极低的额外训练与推理成本下提升生成质量。模型使用三维多模态Rotary Position Embeddings(MM-RoPE)来表达时间维度与两个空间维度(t, h, w)上的位置关系。在训练的最后阶段,团队引入了原生稀疏注意力以降低长序列的计算开销,该实现并未包含在首个开源版本中,将在后续更新中单独发布。
针对2K分辨率的生成需求,团队并未采用传统的专用超分辨率模块,而是通过in-context的方式,使用H3基础模型对自身生成的低分辨率结果进行重新生成。这种方法有两大核心优势:一是可以最大限度复用H3基础模型已有的生成能力;二是in-context的形式可以在生成高清内容时再次利用原始多模态上下文,还原传统超分辨率方法只能通过猜测补充的细节信息,比如小型文字与精细画面元素。这种in-context再生也是任务泛化的典型应用案例。目前该模块暂未开源,团队正在推进相关开源准备工作,一旦完成将第一时间开放,同时提供了专用API用于复现并验证官方的完整生成结果。
为帮助社区成员正确部署与使用MiniMax H3,官方提供了两种验证方案:
1. H3-Base本地部署
MiniMax H3以两个针对特定任务的checkpoint形式发布,每个checkpoint都包含了针对对应任务训练的Omni Transformer模型,以及推理所需的processor、tokenizer、text encoder、Visual VAE与独立Audio VAE。发布的checkpoint均采用了针对具体任务进行CFG Distillation的Omni Transformer权重,以self-contained的形式托管在开源平台上,包含完整的推理所需组件。开发者可以直接从开源平台下载模型,目前H3-Base支持通过SGLang、vLLM、diffusers与ComfyUI等推理框架与工作流进行部署。
以SGLang为例,官方分别提供了FL2VA与Ref2VA两个checkpoint的服务启动配置:FL2VA checkpoint支持T2VA与FL2VA任务,Ref2VA checkpoint支持基于参考图像、视频与音频的Ref2VA任务,开发者可以根据具体任务选择对应的模型变体,并通过多GPU并行完成本地推理。
为帮助社区验证部署结果,官方提供了三类可复现的768p音视频生成案例:
- T2VA:输入完整的H3-Context-IR Prompt,直接生成包含画面、环境音、音效与配乐的完整音视频内容
- FL2VA:以首帧、尾帧或首尾帧作为关键帧,根据H3-Context-IR Prompt生成后续音视频内容
- Ref2VA:联合使用参考图像、视频与音频,实现人物与场景保留、动作与嘴型编辑、音色参考、原始音频复用等复合任务。例如在Ref2VA示例中,模型可以保留原视频中的人物身份、服装、镜头构图、光线与场景,复用原视频的背景音乐,同时参考另一段男性语音的音色,为人物生成新的对白与对应的嘴型动作。
三类案例均支持通过本地API提交生成任务,提供任务状态查询与结果下载的完整流程,完整的请求参数、H3-Context-IR Prompt与复现代码可在开源平台的模型卡片中查看。
2. 完整2K工作流
为帮助开发者验证完整的H3生成流程,官方提供了一套Full 2K Workflow,将本地部署的H3-Base与官方H3-Context-IR、H3-Regenerate-2K API组合使用,以复现通过官方开放平台直接生成的2K视频质量。整个流程分为三个阶段:
- 第一阶段:H3-Context-IR对用户输入的文本、图像、视频与音频等多模态信息进行理解与扩展,生成供H3-Base与后续再生成阶段使用的完整Prompt
- 第二阶段:本地部署的H3-Base根据扩展后的Prompt与输入条件,生成短边为768像素的音视频结果
- 第三阶段:H3-Regenerate-2K将H3-Base生成的768p视频作为`base_video`,结合扩展后的Prompt与原始输入上下文,完成2K分辨率的视频再生成。
官方同样提供了三类完整复现案例:
- T2VA:输入文本Prompt,依次完成H3-Context-IR扩展、H3-Base 768p生成与H3-Regenerate-2K再生成
- I2VA:输入文本与首帧图像,由H3-Context-IR生成扩展Prompt,再通过H3-Base与H3-Regenerate-2K完成首帧图生视频
- Ref2VA:输入文本、参考视频与参考音频,完成多模态参考视频生成,并在2K再生成阶段继续使用原始参考素材与H3-Base的输出。
对于每个案例,官方还提供了通过开放平台API直接生成的2K与768p参考结果,方便开发者对比本地部署与完整工作流的输出效果。在示例代码中,本地H3-Base的输出会被编码为Base64 Data URL并传入H3-Regenerate-2K;在生产环境中,建议将视频上传至可公开访问的URL,并将该URL作为`base_video`传入。完整的接口配置、请求参数、示例代码与参考结果,可前往开源平台的模型卡片查看。
MiniMax H3基于MiniMax H3 Community License进行开源发布。
如有任何疑问,可通过官方官方邮箱进行咨询。
开发者与用户可以通过以下渠道体验与获取MiniMax H3相关资源:
- 官方开放平台API文档
- H3-Context-IR API文档
- H3-Regenerate-2K API文档
- 官方模型托管平台
- 国内AI创作平台
- 开源托管地址:① Hugging Face平台;② 国内模型社区平台
- Intelligence with Everyone.


