免费视频生成新标杆:MiniMax H3的许可限制

近期一款免费开放基础权重的视频生成模型引发了行业关注,它在多项测试中表现亮眼,却附带了不少令人意外的使用限制。
这款名为H3的高清视频生成模型由团队推出,它支持多种类型的输入媒体,能够生成高质量的视频内容。不过其许可协议设置了特殊的地区限制:美国、英国、欧盟和韩国的用户需要额外提交申请,才能按照与其他地区用户相同的条款使用该模型,且模型的核心组件目前仍处于专有状态。
核心规格与使用成本
从核心规格来看,H3的支持能力相当全面:
输入输出方面,最多可同时加载12个文件,涵盖7000字符以内的文本、单文件不超过30MB的图片、15MB以内的音频以及50MB以内的视频;输出则支持最长15秒、宽度最高2000像素的视频,同时可附带音频和文本字幕。
架构层面,该模型基于Transformer架构,参数量达到330亿,配备了独立的文本、音频和视频编码器,以及预处理器和2K视频放大模块。
功能上,H3支持视频与音频编辑、多镜头输出,同时提供六种可选的宽高比适配不同使用场景。
性能表现上,它在第三方视频评测机构的榜单中位居第一,在文本生成视频和图片生成视频任务中排名第二,与第一名的差距处于误差范围内。
成本与可用性方面,模型权重可以免费下载,非商业和商业用途均可在符合许可协议的前提下使用;通过API调用的话,2K分辨率输出的费用为每秒0.13美元,768p分辨率则为每秒0.08美元。输入成本从音频免费,到单张图片0.04美元、高清视频每秒0.13美元不等;提示词重生成模块的收费标准为每百万输入token 0.90美元,每百万输出token 3.60美元。
不过团队并未披露模型的确切参数量、训练数据以及完整的技术报告。
模型运作逻辑
H3的整体架构分为三个核心部分,分别是上下文处理系统、视频与音频生成基础模型,以及高清视频放大器。需要注意的是,只有基础生成模型的权重可以免费下载,且附带使用限制。
在训练逻辑上,团队选择在真实自然的数据集上训练H3,以保障数据质量与训练可扩展性。与早期的视频模型不同,H3将人声、音乐和音效等所有类型的音频整合在一起训练,通过单一编码器完成建模。团队没有使用固定预设,而是通过自然语言来训练模型的参考与编辑功能,同时很早就尝试将不同媒体类型进行融合训练。
H3支持多种生成模式,包括文本生成视频、基于首帧或末帧图片生成视频,以及以图片、音频和视频作为参考进行创作,且支持多种输入类型的任意组合。比如用户可以要求模型以一张静态图片作为开场,参考两段视频的镜头运动轨迹、第三段视频的音轨,再结合文字描述来完成场景创作。
具体的运行流程上,输入内容首先会被H3-Context-IR模块处理:这个推理模块会解析用户的提示词和所有输入媒体,生成新的文本提示来指导基础模型完成内容融合。仅使用基础模型的用户需要自行明确各媒体类型的使用指令,或是搭建自己的预处理系统;而使用完整API流水线的用户则可以直接受益于Context-IR模块,无需自行完成复杂的预处理工作。
基础模型可以生成768p分辨率的视频,默认规格为宽度1792像素、高度768像素,最大支持21:9的宽高比。模型配备了三个独立的编码器分别处理文本、视频和音频,同时还有一个独立的变分自编码器用于视频编码。
第三个模块H3-Regenerate-2K可以将基础模型生成的768p视频重新生成为原生2K分辨率,宽度最高2000像素,最长可达4667像素。优化后的提示词会保留原始媒体参考和用户的原始提示作为上下文,让重生成的视频能够补充缺失的细节,而非单纯对源视频进行外推。
关于许可协议的具体限制,商业用户需要在所有使用H3的产品中显著展示模型名称,所有用户都被禁止基于H3的输出蒸馏出另一个模型,同时禁止使用模型生成可能伤害未成年人、干扰选举或违反当地法律的内容。此外,协议将美国、英国、欧盟和韩国列为排除地区,要求这些地区的权重用户提交申请,以确保使用合法合规且不侵犯任何权利。
行业定位与竞品对比
从行业对比来看,H3的一对一人类偏好ELO分数将其稳稳列入行业前三,与Google的Gemini Omni Flash和字节跳动的Dreamina Seedance 2.0处于同一梯队。Black Forest Labs的FLUX模型通常会推出面向开发者的开放权重版本,但最新的FLUX 3模型转为专有,仅通过API提供服务,目前尚未经过独立测试,但团队内部测试显示其具备冲击行业顶尖水平的潜力。Dreamina Seedance 2.5也尚未完成公开测试。
核心优势与行业启示
尽管H3的许可协议存在严格的使用限制和特殊的地区壁垒,但它无疑仍是目前顶尖的视频生成模型之一,为商业用户提供了功能强大且多样的视频生成工具,足以与Google定价更高的同类竞品相抗衡。通过这款模型,我们也得以窥见顶级视频生成模型的内部运作逻辑。MiniMax放弃合成数据的训练策略,尤其是在高质量视频转录文本较难获取的场景下,以及将提示词优化整合进整体流水线的设计,都取得了不错的效果。
行业观察与思考
在当前AI行业发展的特殊时期,按国家地区限制模型权重的使用,除了针对违反当地法律的用途之外,似乎并无合理依据。这显然违背了开源模型的核心要义:任何人都可以下载模型、了解其运作逻辑并进行使用。我们衷心希望这类地区限制不会成为行业的普遍趋势。

