文章摘要
7月31日,MiniMax发布新一代全模态生成模型MiniMax H3,未来几天将开源,这是国产视频生成大模型首次向社区开源。H3支持多模态统一理解与生成,视频编辑能力全球第一,2K分辨率视频生成仅0.8元/秒。它在多方面表现出色,适用于多商业场景。开源后将降低使用成本,目前其股价涨超14%。

7 月 31 日消息,MiniMax今日正式发布新一代全模态生成模型 MiniMax H3,并宣布将在未来几天内开源模型。


H3 支持文本、图像、视频、音频的统一理解与生成,可输出最高 2K 分辨率、最长 15 秒的音视频内容。在 Artificial Analysis 视频模型榜单中,H3 的视频编辑能力排名全球第一。


定价方面,H3 2K分辨率视频生成仅 0.8 元/秒,只有主流旗舰模型的三分之一。这是国产视频生成大模型首次向社区开源,多模态生成模型有望成为通用助手。


MiniMax H3生成的广告视频


1.png

模型信息


项目

详情

模型定位

通用全模态生成模型(首款开源多模态模型)

输入模态

文本、图像、音频、视频(支持多模态上下文统一理解)

输出

原生双声道音视频

分辨率

最高 2K 直出

时长

最长 15 秒

视频编辑能力

Artificial Analysis 视频模型榜单 全球第一

开源计划

未来几天内开放权重(国产视频模型首次开源)

价格

2K 分辨率 0.8 元/秒,不足主流旗舰 1/3


2.png

全模态理解


H3 的最大突破在于参考类型不只是图片、视频、声音,编辑和参考不再单一,而是在多模态上下文中统一理解。用户多种类型的素材放在同一上下文中,由模型统一理解画面、声音、文字、创作要求,再完成内容生成或编辑。


例如输入视频1、图片1和音频1,即可得到2K画质的唱歌视频。


ezgif-20ea8e8cf9132337 (1).gif

视频1


下载 (33).png

图片1


下载 (34).png

音频1


ezgif-299d03753d6420da (1).gif

成品


H3 在指令遵循、文字与品牌信息呈现、视频到视频动作迁移 等方面表现出色,能可控地实现多模态内容编辑与生成。广泛适用于广告、品牌、电商、产品设计、UI/UX、游戏等商业场景。


3.png

技术亮点


上下文重生成 :H3 的 2K 视频输出没有使用常规超分模块,而是让基础模型对自己的低分辨率结果进行重新生成。这最大程度复用基模的生成能力,还能还原传统超分方案无法靠猜恢复的细节信息。


下载 (35).png


技术栈:上下文全模态表示、H3-VAE、H3-Omni Transformer、In-context Regeneration 等。其中 H3-VAE 的高压缩 Tokenizer 实现了 4 倍有效序列长度增益,大幅降低训练和推理成本。


训练优化:针对视频长度、分辨率和多模态理解与生成负载差异较大的特点,MiniMax 在异构训练、负载均衡和 GPU 利用效率等方面进行了系统优化。


4.png

开源生态


H3 是 MiniMax 推出的首款开源多模态生成模型,公司此前已开源三代 M 系列文本模型。


MiniMax 相关负责人表示:“H3 将于未来几天内开源,企业可以在本地灵活部署……芯片厂商和开发者也能共同参与适配和优化,降低使用成本,扩大应用范围。 ”


截至发稿,MiniMax(0100.HK)股价涨超 14%,市场对 H3 的发布给予了积极反馈。


5.png

结语


从 Hailuo 01 到 Hailuo 02,再到今天的 H3,2K 分辨率、15 秒时长、0.8 元/秒的价格、即将开源的权重,MiniMax 正在将视频生成推向商业级。


H3 今日起已在官方平台上线,随着权重开源,国产模型的生态协同将进入一个全新阶段。


下载.png


塔猴是一个专业的AI接单平台,汇聚海量真实商单。所有商单均经人工审核认证,真实有效。入驻零门槛,零保证金,交易通过三方监管账户托管,专业运营团队全流程参与交付,阶段验收达标后结款。


同时,塔猴也为想提升技能的用户提供AIGC实战课程与前沿资讯,让你在学习和实战中成长。


点击进入:https://www.tahou.com/

以上内容不代表本平台立场,仅供读者参考