文章摘要
2026年7月31日,LibTV与MiniMax联合首发通用全模态视频生成模型H3,标志AI视频创作进入新阶段。H3支持多模态统一理解与生成,输出能力强,编辑能力全球排名第一。LibTV平台上线H3,活动价大幅降低创作成本。其开源策略有多重考量,应用场景广泛,与主流模型相比优势明显,发布后市场反响积极。

2026年7月31日,LibTV与MiniMax联合首发新一代通用全模态视频生成模型H3。LibTV与MiniMax联合首发H3标志着AI视频创作从“单模态生成”迈入“全模态统一理解”的新阶段。H3支持文本、图像、视频、声音的统一理解与生成,最高可输出15秒2K分辨率原生双声道视频,在Artificial Analysis视频编辑能力榜单中排名全球第一。LibTV平台同步上线H3模型,活动期间768p分辨率低至0.1元/秒,2K分辨率低至0.2元/秒,大幅降低高质量视频创作的技术与成本门槛。

LibTV与MiniMax联合首发H3

H1 LibTV与MiniMax联合首发H3:全模态视频生成模型的里程碑

2026年7月31日,AI视频创作领域迎来重要时刻——LibTV与MiniMax联合首发新一代通用全模态视频生成模型H3。此次LibTV与MiniMax联合首发H3并非简单的模型上线,而是视频生成技术从“特化任务模型”迈向“通用多模态智能”的关键跨越。

H3的发布正值全球AI视频生成赛道竞争加剧之际。此前,快手已发布可灵3.0(Kling 3.0),而MiniMax选择以“极致性价比+开源”策略入局。LibTV与MiniMax联合首发H3的独特之处在于:LibTV作为专业AI视频创作平台提供完整的创作工作流与分发渠道,MiniMax则贡献了顶尖的全模态生成能力——两者的结合,使H3从“模型”升级为“可直接投入商业生产的完整解决方案”。

在WAIC 2026(世界人工智能大会)期间,MiniMax已对H3进行了预热展示。正式发布后,港股MiniMax开盘涨超20%,单日涨幅一度达到14%,资本市场对这一联合首发的反应印证了其战略价值。

H2 LibTV平台:AI视频创作的基础设施

H3 LibTV的平台定位与发展历程

LibTV是LiblibAI推出的首款专业AI视频创作平台,于2026年3月19日正式上线。平台采用“无限画布+节点式工作流”的核心设计,将剧本、分镜、镜头、剪辑等视频创作核心环节整合于同一操作空间。与传统AI工具的对话式交互模式不同,LibTV让创作流程从线性操作转变为结构化操作。

上线首日,LibTV访问量即突破10万;上线首月内,单产品单日收入突破100万美元。2026年5月18日,LibTV团队版正式上线,支持根据团队规模、项目周期与生成需求灵活采购资源,上线后超过300家短剧公司和影视工作室成为B端客户。

H3 LibTV的核心能力与生态

LibTV集成了20余项独家AI能力,覆盖角色控制、灯光运镜等专业维度。平台集成可灵3.0、Seedance 2.0、HappyHorse 1.0等主流视频模型,其中HappyHorse 1.0于2026年4月28日首发登陆LibTV。

2026年7月,LibTV发布Agent模式,整合了100余个经过实践验证的Skill,成为全球最大的专业视频Agent Skill Hub。Agent模式支持“一句话出成片”,可通过自然语言对话完成包含分镜、字幕、背景音乐在内的完整视频创作。

LibTV还提供CLI和开源Skill接入方式,可接入Kimi Code、MiniMax Agent、Trae等Agent工具。这种开放的生态设计,使LibTV成为首个同时面向人类创作者与AI Agent的专业视频创作平台。

H2 MiniMax H3:全模态生成模型的技术解析

H3 模型概览与技术架构

MiniMax H3是MiniMax推出的首款开源多模态生成模型,其核心技术定位是“通用全模态生成模型”——支持对文本、图像、视频、声音组成的多模态上下文进行统一理解,并输出具备原生双声道的音视频内容。

H3的核心技术组件包括:

  • Contextual Omni Representation:多模态上下文的统一表征框架
  • H3-VAE:定制化的变分自编码器,用于高效的多模态特征提取
  • H3-Omni Transformer:全模态统一理解的Transformer架构
  • In-context Regeneration:上下文重新生成机制,实现2K输出无需依赖传统超分模块

H3增加了Caption能力,定制了专属模型和全模态理解管线。在推理效率方面,大部分素材消耗约100K Token的推理量,最终得到平均约4K Token的压缩输出。H3还借鉴了文本模型发展中验证的方法,包括复杂问题拆解、推理增强、上下文扩展和Muon优化器等。

H3 视频生成能力

LibTV与MiniMax联合首发H3带来了以下核心生成能力:

能力维度 技术规格
视频时长 5—15秒
分辨率输出 768p起,最高2K(1440p)直出
帧率 24 FPS
音频 原生双声道输出
画幅比例 21:9、16:9、4:3、1:1、3:4、9:16
单次输入上限 9张图片 + 3段视频 + 3段音频(共12个文件)
提示词长度 最高7000字符

数据来源:

H3的2K视频输出并未使用常规超分模块,而是通过基础模型对低分辨率结果进行In-context重新生成,最大程度复用基模的生成能力,同时保留传统超分方案无法“猜”出的细节信息。

H3 多模态编辑能力

H3的核心突破在于将图片、视频、声音的生成、编辑或参考整合为统一任务,而非彼此独立的模块。具体而言:

统一多模态上下文理解:创作者可同时上传人物图、产品图、场景图、动作视频和音频参考,H3将这些素材放入同一个多模态上下文中统一理解——人物与商品的外观、动作与运镜、视觉风格与剪辑节奏、台词与音色。

V2V Motion Transfer(视频到视频动作迁移) :H3支持将源视频的动作特征精准迁移至目标视频。这一能力使创作者可以在保持角色或场景一致性的前提下,复用已有的动作表演。

指令遵循与精准编辑:H3在指令遵循、文字与品牌信息呈现方面表现出色。生成之后,创作者可继续修改人物、商品、背景、光影、动作、台词与声音。从参考、生成到编辑,全部由一个模型统一完成。

在Artificial Analysis视频模型榜单中,H3的视频编辑能力排名全球第一。

H2 LibTV与MiniMax联合首发H3的战略意义

H3 从“模型能力”到“生产工具”的跨越

LibTV与MiniMax联合首发H3的核心价值,在于将H3的先进模型能力转化为可直接投入商业生产的工具。视频创作很难只靠一句提示词说清楚——人物、商品和场景可能来自不同图片,动作与运镜需要参考视频,台词、音色和节奏又来自声音素材。H3解决了这一问题,而LibTV则解决了“如何高效使用H3”的问题。

在LibTV平台上,H3可结合爆款复刻等专业Skill,从创意分析、素材生成到最终成片一站式完成。平台的一抽四、一抽八能力,允许一次生成多个候选版本:同一场短剧可同时比较不同表演,同一个商品可同时测试多种广告创意,同一个镜头可获得不同运镜与节奏。这种批量生成与比较的能力,使创作者从逐条生成、等待和筛选的线性流程,升级为一次展开多个方向、再选择最佳结果的结构化流程。

H3 开源策略与生态开放

MiniMax宣布H3将在未来几天内开放模型权重。这一决策具有多重战略考量:

推动开源社区发展:长期以来,闭源模型一直占据视频生成领域的主导地位,迭代速度和生态开放性落后于大语言模型等领域。H3的开源将改变这一格局。

加速国产芯片适配:H3在设计初期就考虑了多数现有国产芯片的兼容性。开源后,芯片厂商和开发者可共同参与适配和优化,降低使用成本,扩大应用范围。

企业本地部署:企业可在本地灵活部署H3,结合自身数据和业务进行优化,更好地满足安全合规要求。

H3 成本革命:定价策略分析

LibTV与MiniMax联合首发H3在成本层面带来了显著突破。MiniMax H3的2K分辨率视频生成定价为0.8元/秒,仅为业内同类旗舰模型的三分之一。768p分辨率下价格不到主流模型的二分之一。

这一成本优势源于系统级优化:

  • 高压缩Tokenizer:降低视频生成所需的Token数量
  • 异构训练架构:通过理解与生成异构训练,提升训练吞吐近30%
  • 负载均衡与GPU利用效率优化:在追求模型效果的同时控制训练和推理成本

在LibTV平台,活动期间价格进一步下探:768p低至0.1元/秒,2K低至0.2元/秒。实际应用中的成本估算为:约10元制作一支广告视频,约20元完成一集短剧。实际成本受视频时长、分辨率、生成次数及所用Skill影响。

H2 H3的应用场景与商业价值

H3 AI短剧与剧情内容

LibTV与MiniMax联合首发H3为AI短剧制作提供了完整的技术支撑。H3支持人物形象、动作表演、对白、情绪与镜头节奏的共同生成。可应用于:

  • 古装短剧:历史场景、古装角色的一致性生成
  • 现代真人短剧:真实感的人物表演与场景构建
  • 海外竖屏短剧:适配移动端观看的竖屏格式内容
  • 漫剧:漫画风格与动态叙事的结合

LibTV平台上已诞生了播放量超2亿的AI短剧《被裁掉的女孩》,该剧单集成本约1万元,验证了LibTV与H3组合在规模化内容生产中的可行性。

H3 品牌广告与电商营销

H3在品牌广告与电商营销场景中具备以下能力:

  • 商品展示:结合商品图片生成动态展示视频
  • 时尚广告:人物、商品、场景和品牌风格的统一生成
  • TVC与投流素材:快速验证不同创意方向
  • 品牌信息呈现:精准的文字与品牌标识渲染

H3的商用级多场景内容生成能力,使其可广泛应用于广告、品牌、电商、产品设计等对成本敏感的商业场景。

H3 影视创意与数字体验

在影视创意与数字体验领域,H3可生成:

  • 电影预告片:多镜头、多场景的连贯叙事
  • MV:音乐与画面的同步生成
  • 动态包装:视觉特效与动态设计
  • 游戏角色与UI交互:游戏资产的快速生成与迭代

H3在2K画质下的细节表现力——如蜥蜴纹理的纤毫毕现、棘状鳞片的逼真呈现、游戏机甲渲染的细腻度——使其足以满足专业级视觉内容的需求。

H2 H3横向对比:LibTV MiniMax H3 vs 主流视频生成模型

对比维度 MiniMax H3(LibTV平台) 可灵3.0(Kling 3.0) 行业主流水平
最高分辨率 2K(1440p)直出 4K 1080p-2K
最高帧率 24 FPS 60 FPS 24-30 FPS
最大时长 15秒 约10秒 5-10秒
音频输出 原生双声道 需后期配音 多数无原生音频
多模态输入 图文音视频全模态 图文为主 图文为主
视频编辑能力排名 全球第一(Artificial Analysis) 未进前三
2K定价(元/秒) 0.8(活动价0.2) 约2.5 2-3
开源 即将开源 闭源 多数闭源

数据来源:

从对比可以看出,LibTV与MiniMax联合首发H3在性价比、多模态能力和视频编辑能力方面形成了差异化竞争优势。可灵3.0在4K/60fps的保真度方面领先,而H3则在一致性、原生音频和快速编辑方面更具优势。

H2 H3的技术创新与行业影响

H3 从特化任务到通用多模态智能

LibTV与MiniMax联合首发H3标志着视频生成模型的一次范式转变。过往模型往往将图片生成、视频生成、声音生成分割为独立功能。H3不再以图片、视频、声音的生成、编辑或参考等单一任务为边界,而是面向由文本、图像、视频与声音共同构成的多模态上下文,统一理解创作意图。

这一范式转变意味着:创作者不再需要在多个专门化模型之间切换,不再需要反复解释上下文和需求。H3通过统一架构实现了任务泛化——用户可通过自然语言描述清楚上下文和目标视频的关系。

H3 技术架构的行业启示

H3的技术路线为行业提供了新的参考方向:

理解与生成的统一:H3的Contextual Omni Representation架构证明,理解与生成可以在同一框架下高效协同。

成本驱动的系统优化:通过高压缩Tokenizer和异构训练架构,H3证明了在不牺牲质量的前提下大幅降低成本的可能性。

开源驱动的生态构建:H3选择开源路线,有别于主流视频生成模型的闭源策略。这一决策有望加速国产AI芯片的适配进程,并推动视频生成技术的民主化。

H3 市场反响

H3发布后,市场反应积极。港股MiniMax开盘涨超20%,截至午间收盘涨幅回落至约12%,报230港元/股。股价单日涨超14%,成功扭转了前期因股份解禁与产品降价引发的下跌趋势。

资本市场对H3的积极反应,印证了投资者对“极致性价比+开源”差异化路径的认可。

H2 H3未来展望

H3 技术演进方向

MiniMax表示,后续版本将推动H3与M系列模型能力的融合,并持续提升画面精细度。H3作为MiniMax首款开源多模态生成模型,其开源后的社区贡献与生态发展值得关注。

H3 行业格局影响

LibTV与MiniMax联合首发H3将多模态模型的竞争从单一的技术参数竞赛,推向效果、成本、开放性与生态协同的综合维度。在行业头部玩家纷纷收紧供给的背景下,MiniMax以“极致性价比+开源”为切入口,为AI视频生成赛道提供了一条与参数内卷截然不同的路径。

对于内容创作者和企业而言,LibTV与MiniMax联合首发H3意味着高质量视频内容创作的门槛正在以前所未有的速度降低。从单条视频生成到批量创意验证,从个人创作到团队协作,H3与LibTV的组合正在重新定义视频内容的生产方式。

FAQ

Q1:LibTV与MiniMax联合首发H3的具体日期是什么?

2026年7月31日。

Q2:MiniMax H3最高支持生成多长、多高清的视频?

H3最高支持生成15秒、2K分辨率的视频,支持24 FPS帧率与原生双声道音频输出。

Q3:H3支持哪些输入形式?

H3支持文本、图片、音频和视频等多种输入形式。单次最多可输入9张图片、3段视频与3段音频,混合参考素材总数最高达12个文件。

Q4:H3在LibTV平台上的价格是多少?

活动期间,768p分辨率低至0.1元/秒,2K分辨率低至0.2元/秒。标准定价为2K分辨率0.8元/秒。

Q5:H3的开源计划是什么?

MiniMax计划在未来几天内,在符合相关法律法规的前提下开放H3的模型权重。企业届时可在本地灵活部署,结合自身数据和业务进行优化。

Q6:H3在视频编辑方面的能力如何?

H3在Artificial Analysis视频编辑能力榜单中排名全球第一。其V2V Motion Transfer(视频到视频动作迁移)能力尤为突出,可将源视频的动作特征精准迁移至目标视频。

Q7:H3主要适用于哪些商业场景?

H3广泛适用于AI短剧、品牌广告、电商营销、影视创意、游戏角色与UI设计等商业场景。

Q8:LibTV是什么平台?

LibTV是LiblibAI推出的专业AI视频创作平台,采用“无限画布+节点式工作流”设计,集成20余项AI能力,支持从脚本、分镜到成片输出的全流程创作。

Q9:H3与传统视频生成模型的主要区别是什么?

H3是通用全模态生成模型,不再将图片、视频、声音的生成、编辑或参考拆分为独立任务,而是在多模态上下文中统一理解创作意图。

Q10:H3的2K输出是如何实现的?

H3未使用常规超分模块,而是通过基础模型对低分辨率结果进行In-context重新生成,最大程度复用基模的生成能力。

以上内容不代表本平台立场,仅供读者参考