文章摘要
MiniMax开发的通用多模态视频生成模型H3已开源,它能统一理解多模态上下文,支持文生音视频、2K生成,单段视频最长15秒,生成成本低。支持多素材联合参考生成,可用于影视、广告等多场景。有H3 - Base - FL2VA和H3 - Base - Ref2VA两个版本,完整系统含三个核心模块。文中还介绍了本地部署与2K工作流方法。

一款由MiniMax开发的通用多模态视频生成模型H3正式完成开源。该模型能够统一理解文本、图像、视频和音频等多模态上下文,支持生成带有原生立体声音频的视频内容,最高可输出2K分辨率的作品,单段视频最长可达15秒。在指令遵循、文字与品牌标识准确渲染、视频到视频运动迁移等方面表现突出,可广泛应用于影视片头、广告营销、电商展示、产品设计、UI/UX制作以及游戏开发等多个场景。依托H3-VAE、H3-Omni Transformer、In-Context Regeneration等核心技术,H3在生成成本上优势显著:2K分辨率下每秒生成成本仅为主流模型的三分之一以内,768p分辨率下则不到主流720p模型的一半。

核心能力与应用场景

H3支持多素材联合参考生成,用户可以组合使用文本、图像、视频和音频素材,通过自然语言描述人物动作、镜头语言、声音风格等元素之间的关联关系。在“全能参考”模式下,单次任务最多可输入9张图像、3段视频和3段音频,所有混合素材总数不超过12个,且音频必须配合图像或视频一同使用。官方曾展示过基于多素材组合输入生成的视频案例,帮助用户快速生成符合预期的视频内容。

在商业内容生成领域,H3覆盖了影视、广告、品牌宣传、电商展示、产品设计、UI界面设计以及游戏开发等多个核心场景。官方展示的案例包括影视片头制作、动态海报设计、电商广告视频以及游戏UI动效生成等,重点呈现了文字、品牌信息、视觉特效、产品元素以及界面组件在视频中的精准组合生成效果。

此外,H3单次可输出4至15秒的视频内容,帧率固定为24FPS,且每段生成视频都自带原生双声道音频。在画面比例方面,文生视频和全能参考模式支持21:9、16:9、4:3、1:1、3:4、9:16等多种比例,首尾帧生成模式则会自动匹配输入图像的原始比例。

模型基础规格与版本

H3作为通用型全模态生成系统,支持的输入输出规格如下:

  • 输出时长:4至15秒
  • 输出宽高比:支持21:9、16:9、4:3、1:1、3:4、9:16等多种常见比例
  • 输出分辨率:默认短边为768像素,通过H3-Regenerate-2K模块可实现2K分辨率生成
  • 输出帧率:24FPS
  • 输出音频:32kHz立体声
  • 支持语言:稳定支持阿拉伯语、中文、英语、法语、德语、意大利语、日语、韩语、葡萄牙语、俄语、西班牙语共11种语言,对其他语言也提供不同程度的支持

H3目前有两个主要的模型版本:

1. H3-Base-FL2VA:支持首尾帧生成模式,可输入0、1或2张图像:

  • 无输入图像时为纯文生视频模式
  • 输入单张首帧图像为首帧驱动生成模式
  • 输入单张尾帧图像为尾帧驱动生成模式
  • 同时输入首尾帧则为首尾帧约束生成模式

2. H3-Base-Ref2VA:全模态参考模式,支持多素材混合输入:

  • 图像:最多9张
  • 视频:最多3段,单段时长2至15秒,总时长不超过15秒
  • 音频:最多3段,必须配合图像或视频输入,单段时长2至15秒,总时长不超过15秒
  • 混合输入:所有类型素材合计最多12个

完整的H3系统由三个核心模块组成:

  • H3-Context-IR:这是一套托管式的预处理与编排系统,专为处理自由形式的多模态输入设计。它能够理解文本、图像、音频和参考视频之间的关联关系,以及这些素材与最终生成结果的对应逻辑,内部包含指令解析、跨模态关联、时序理解和复杂逻辑推理等流程。H3-Context-IR会将对上下文的理解序列化为结构化表示,供H3-Base直接使用,还可以在不偏离用户原始意图的前提下补充缺失或描述不充分的语义细节。由于该模块依赖多阶段工作流和多个托管模型服务,本次开源并未包含该模块,官方提供了API帮助用户复现官方工作流,同时也提供了提示词指南供开发者搭建自定义的上下文处理系统。
  • H3-Base:根据H3-Context-IR的输出结果生成音频和视频内容,默认输出768p分辨率的作品。
  • H3-Regenerate-2K:将768p的生成结果连同原始上下文一同送回模型,以2K分辨率重新生成最终作品,既复用了H3基础模型的生成能力,又能利用原始上下文信息还原更精准的细节内容,比如小字体和精细视觉元素。

在安全防护机制上,用户提交的文本、图像和视频,以及经过增强的Prompt,均会接受自动化内容审核。涉嫌违法、色情或侵犯第三方权利的内容可能会被拦截。官方采用行业标准的过滤措施,但无法完全避免误判或漏判。上述安全防护机制不影响被许可方在MiniMax H3 Community License下应承担的义务,尤其是与合法使用和使用限制相关的义务。

模型架构细节

H3-Base的整体架构采用多模态统一编码的思路:使用对应模态的编码器或VAE对不同类型的输入进行编码,将编码后的表示整合为统一的packed multimodal sequence,再通过旋转位置编码表达token之间的空间和时间关系,最后将整个序列输入H3-Omni-Transformer模型。

具体来说,文本内容由H3-Encoder进行编码;视觉输入同时通过H3-Encoder和H3-VisualVAE进行双重编码;音频内容仅通过H3-AudioVAE进行编码。H3-Omni-Transformer会联合预测视频latent和音频latent,随后分别解码为最终的视频文件和立体声音频。为了降低长多模态序列的计算开销,H3原生支持稀疏注意力训练与推理,首个开源版本仅提供全注意力推理,稀疏注意力的实现将在后续更新中发布。

H3-Encoder

H3-Encoder使用Qwen3-VL-32B的完整预训练权重,并将模型第50层的hidden states作为输出提供给H3-Omni-Transformer。此外,H3在tokenizer配置中新增了多个特殊token,使用H3时必须采用模型仓库中提供的专用tokenizer和相关配置文件。

H3-VAE

H3分别使用独立的视觉和音频latent来表示对应模态:

1. H3-VisualVAE:这是一个采用时间因果结构的视频自编码器,空间压缩倍率为16倍,时间压缩倍率为4倍,latent通道数为24。该模块采用了多种latent空间优化技术,同时提升了重建质量和latent的可学习性。在输入H3-Omni-Transformer之前,视觉latent会按照时间、高度和宽度三个维度进行patchify处理,最终进入Transformer的视觉token等效拥有32倍的空间下采样倍率,时间下采样倍率仍保持为4倍。在完成encoder训练后,官方还额外训练了一个基于ViT的decoder,以降低解码成本并进一步提升重建质量。

2. H3-AudioVAE:使用独立的编码器和解码器分别处理左右两个音频声道,随后将解码后的声道重新组合,实现立体声音频的输入和输出。对于每个声道,H3-AudioVAE会将32kHz的原始音频压缩为时间频率为40Hz的latent token序列。该模块参考了VA-VAE的设计思路,对latent空间进行了优化,在保持音频重建质量的同时,让生成模型更容易学习。

H3-Omni-Transformer

为了实现良好的可扩展性和泛化能力,H3采用了相对简洁的Transformer block设计。H3-Omni-Transformer是一个拥有33B参数的dense single-stream Transformer,其中约13B参数位于与AdaLN相关的分支中。由于AdaLN的调制输出可以预先计算并缓存,在仅用于推理的部署场景中,无需加载这部分参数。官方发布了完整的模型权重,支持包括微调在内的后续开发工作。

该模型的attention层和FFN层均不包含模态专属结构,与模态相关的参数仅存在于输入/输出层和AdaLN分支中,模态专属的AdaLN能够以较低的额外训练和推理成本提升生成质量。模型使用三维Multimodal Rotary Position Embeddings来表达时间维度和两个空间维度上的位置关系。在训练的最后阶段,官方引入了原生稀疏注意力以降低长序列的计算开销,但首个开源版本并未包含该功能,将在后续更新中单独发布。

H3-Regenerate-2K

对于2K分辨率的输出需求,H3并未采用传统的专用超分辨率模块,而是通过in-context的方式,使用基础模型对自身生成的低分辨率结果进行重新生成。这种方法有两个核心优势:再生成过程可以最大限度复用H3基础模型已有的生成能力;In-context的形式能够在生成高分辨率结果时再次利用原始多模态上下文,还原传统超分辨率方法只能通过“猜测”补充的细节信息,比如小字体和精细视觉元素。该模块目前尚未开源,官方正在完成相关开源准备工作,完成后将第一时间发布,同时也提供了API供用户复现官方的完整生成流程。

本地部署与使用方法

完整的H3系统由H3-Context-IR、H3-Base和H3-Regenerate-2K三个模块组成,完整的2K工作流需要结合官方托管的H3-Context-IR和H3-Regenerate-2K服务,而本部分仅介绍本地部署H3-Base以生成768p分辨率作品的方法。

模型发布形式

MiniMax H3以两个task-specific checkpoints的形式发布,每个checkpoint都采用了针对具体任务进行CFG Distillation的Omni Transformer权重。每个checkpoint都是自包含的模型仓库,包含了推理所需的全部组件:processor、tokenizer、text encoder、Omni Transformer、Visual VAE和独立的Audio VAE。

H3-Base目前已经支持通过DiffSynth-Studio、SGLang、vLLM、diffusers和ComfyUI等多个推理框架和工作流进行部署。

模型下载

modelscope download \
  --model MiniMax/MiniMax-H3 \
  --local_dir ./MiniMax-H3

DiffSynth推理

文生视频的推理脚本示例如下:

import torch
from diffsynth.pipelines.minimax_h3_audio_video import MiniMaxH3Pipeline, ModelConfig
from diffsynth.utils.data.audio_video import write_video_audio
from modelscope import dataset_snapshot_download
from PIL import Image

vram_config = {
“offload_dtype”: “disk”,
“offload_device”: “disk”,
“onload_dtype”: torch.bfloat16,
“onload_device”: “cpu”,
“preparing_dtype”: torch.bfloat16,
“preparing_device”: “cuda”,
“computation_dtype”: torch.bfloat16,
“computation_device”: “cuda”,
}

pipe = MiniMaxH3Pipeline.from_pretrained(
torch_dtype=torch.bfloat16,
device=“cuda”,
model_configs=[
ModelConfig(model_id=“MiniMax/MiniMax-H3”, origin_file_pattern=“FL2VA/text_encoder/model*.safetensors”, *vram_config),
ModelConfig(model_id=“MiniMax/MiniMax-H3”, origin_file_pattern="FL2VA/transformer/model
.safetensors", **vram_config),
ModelConfig(model_id=“MiniMax/MiniMax-H3”, origin_file_pattern=“FL2VA/video_vae/source/model.safetensors”, **vram_config),
ModelConfig(model_id=“MiniMax/MiniMax-H3”, origin_file_pattern=“FL2VA/audio_vae/model.safetensors”),
],
vram_limit=torch.cuda.mem_get_info(“cuda”)[1] / (1024 ** 3) - 2,
)

prompt = “A girl is very happy, she is speaking in english: “I enjoy working with Diffsynth-Studio, it’s a perfect framework.””
video, audio = pipe(
prompt=prompt,
height=480, width=832, num_frames=124,
num_inference_steps=50, seed=0,
)

write_video_audio(
video=video,
audio=audio,
output_path=“minimax_h3_t2va.mp4”,
fps=24,
audio_sample_rate=pipe.audio_vae.sample_rate,
)

SGLang部署

H3-Base提供FL2VA和Ref2VA两个任务变体:FL2VA支持文生音视频及首尾帧生成,Ref2VA则面向图像、视频和音频等多素材参考生成。

首先从源码构建SGLang:

# Use the latest release branch
git clone https://github.com/sgl-project/sglang.git
cd sglang
# Install the Python packages
pip install --upgrade pip
pip install -e "python[diffusion]"
# With uv
uv pip install -e "python[diffusion]" --prerelease=allow

启动SGLang服务时,可以通过`--model-variant`参数选择对应的模型变体:

FL2VA模式:

sglang serve \
  --model-path MiniMax/MiniMax-H3 \
  --num-gpus 4 \
  --ulysses-degree 4 \
  --performance-mode speed \
  --host 0.0.0.0 \
  --port 30010 \
  --model-variant fl2va

Ref2VA模式:

sglang serve \
  --model-path MiniMax/MiniMax-H3 \
  --num-gpus 4 \
  --ulysses-degree 4 \
  --performance-mode speed \
  --host 0.0.0.0 \
  --port 30011 \
  --model-variant ref2va

完整的2K工作流

本地开源的H3-Base仅负责生成768p分辨率的音视频内容,完整的2K输出流程需要三个步骤:

  1. 通过H3-Context-IR整理多模态输入内容
  2. 使用本地部署的H3-Base完成基础的768p视频生成
  3. 调用H3-Regenerate-2K API将低分辨率结果升级为2K分辨率的最终作品

该流程属于本地模型与官方服务结合的混合部署方案,具体的调用示例可参考官方发布的完整2K工作流指南。

以上内容不代表本平台立场,仅供读者参考