文章摘要
近期上线的MiniMax H3视频生成模型引发关注。它支持多类型参考素材输入,可输出2K分辨率视频,价格优惠,768p最低0.1元/秒。与竞品对比,H3按提示词执行叙事的完成度更高。该模型还能快速补全素材、复刻音色,对真人素材支持友好。不过,它存在无法完成跨场景硬切等局限。其上线标志行业竞争转向成本与易用性。

近期,一款名为H3的视频生成模型正式上线,作为综合性AI企业推出的新品,它打破了此前视频生成领域单一模态参考的局限,引发了创作者群体的广泛关注。测试团队对这款模型进行了近一天的全方位体验,生成了近二十条成片,以下是详细的实测报告。

这款模型最核心的突破在于,支持多类型参考素材输入:最多可同时上传9张图片、3段视频、3段音频,总计12个参考文件。创作者可以通过图片指定人物外貌,通过视频参考运镜节奏,甚至可以上传一段音频来复刻目标音色,实现画面、动作与声音的统一。这种将音频纳入参考维度的设计,是同类产品中较为少见的,也是对视频创作者极具价值的功能。

生成参数方面,H3支持主流的横竖屏比例,最高可输出2K分辨率的视频,时长可选5到15秒。在合作平台上,2K分辨率的生成价格最低为0.2元每秒,具体会根据订阅套餐有所调整。不过这款模型也存在明显的局限:当用户要求跨场景硬切、精确到秒的音效点位,或是多段文字按时序弹出时,模型往往无法严格执行。但如果明确单个场景与状态的需求,它的执行精度会非常高,掌握这一使用逻辑后,就能高效发挥这款模型的优势。

1. 与主流竞品的实测对比

为了直观对比H3与当前主流的同类产品表现,测试团队设计了一致性测试:使用完全相同的提示词,分别生成两款模型的15秒视频,参数对齐各自的主力档位(H3为2K分辨率,竞品无2K档,采用1080p档位)。第一组测试提示词为:15秒写实跟踪镜头短片:一名身着橙色风衣的年轻女性穿行于傍晚热闹的市集,先后被迎面走来的人群、水果摊的条纹遮阳伞、推过的自行车三次短暂遮挡,每次遮挡结束后镜头都能精准重新对准她,保持其面部、发型、白色高领内搭与橙色大衣的细节一致,最终她在摊位前停下,回头对着镜头微笑。整体采用自然光,画面风格写实自然。

15秒写实跟踪镜头短片:一名身着橙色风衣的年轻女性穿行于傍晚热闹的市集,先后被迎面走来的人群、水果摊的条纹遮阳伞、推过的自行车三次短暂遮挡,每次遮挡结束后镜头都能精准重新对准她,保持其面部、发型、白色高领内搭与橙色大衣的细节一致,最终她在摊位前停下,回头对着镜头微笑。整体采用自然光,画面风格写实自然。

逐帧对比后发现,H3完整执行了所有的镜头要求:开场时人群擦过镜头,中段女性走入遮阳伞棚后重新出现,最后自行车从前景划过,全程保持了人物细节的一致性,结尾也精准停在了指定的摊位前。而竞品的表现则超出预期:前半段并未出现橙色风衣的主角,仅展示了清晨市集的空镜,主角直到后半段才登场,且三次遮挡的镜头逻辑并未匹配提示词。虽然竞品的光影质感更写实,但在严格按照提示词执行叙事的表现上,H3的完成度明显更高。

测试团队还使用了另一组广告类提示词,验证模型对分镜的执行能力:15秒4:3复古画风产品短片,0-3秒:一台橙色复古电视机在纯白背景中央缓慢开机,屏幕亮起雪花;3-7秒:镜头推进,雪花变为清晰的像素猫,猫咪眨眼;7-11秒:镜头环绕电视机一周,背景从白色渐变为暖黄色;11-15秒:电视屏幕定格猫咪笑脸,浮现黑色无衬线文字「打开就有好心情」,静停收尾。

15秒4:3复古画风产品短片,0-3秒:一台橙色复古电视机在纯白背景中央缓慢开机,屏幕亮起雪花;3-7秒:镜头推进,雪花变为清晰的像素猫,猫咪眨眼;7-11秒:镜头环绕电视机一周,背景从白色渐变为暖黄色;11-15秒:电视屏幕定格猫咪笑脸,浮现黑色无衬线文字「打开就有好心情」,静停收尾。
时间区间 生成要求 完成情况
0-3s 电视机开机,屏幕亮起雪花效果 ⚠️ 亮屏速度偏慢,雪花效果不明显
3-7s 镜头推进,雪花变为像素猫并眨眼 ✅ 完全匹配要求
7-11s 镜头环绕电视机一周,背景从白色渐变为暖黄色 ✅ 环绕镜头完整覆盖电视机背面,背景颜色按时切换
11-15s 屏幕定格猫咪笑脸,添加指定文字并静停收尾 ✅ 文字「打开就有好心情」准确无误,收尾静停符合要求

在定价方面,平台在推广期给出了极具竞争力的优惠:768p分辨率的视频最低仅需0.1元每秒,2K分辨率则为0.2元每秒。以最低档位计算,一条15秒的2K视频仅需3元左右。测试团队生成的一条视频消耗了198积分,原价330积分,相当于享受了6折优惠。对比相关API服务平台的定价,2K分辨率每秒约0.94元,同样的视频成本可达14元,可见平台的推广补贴力度较大。

从性价比来看,H3的生成效果约达到竞品的80%,但价格仅为其一半左右,相同预算下最多可生成4条视频。平台还支持一次生成4个或8个版本的功能,创作者可以直接挑选最符合需求的成片,大幅提升了创作效率。单条生成的结果存在一定的随机性,测试过程中也出现了不少翻车的案例,但低成本的生成方式让这种随机性从风险变成了资源——创作者无需字斟句酌地优化单条提示词,而是可以批量生成多个版本,再从中挑选最优结果。

2. 快速补全创作缺口与音色复刻

在日常视频创作中,经常会遇到临时缺少素材的情况。比如测试团队在剪辑一支口播视频时,需要一个“吃饭时看手机发现工作完成”的镜头,但当时并未拍摄相关素材,传统的解决方案要么是补拍,要么是放弃这个镜头。而使用H3后,只需要指定参考形象与场景,就能快速生成所需的B-roll素材。

测试团队使用自己的扁平插画形象作为参考,生成了两条8秒的卡通短片:一条展示“合上电脑,云端任务仍在进行”的场景,结尾定格在合上的电脑上方漂浮着发光云朵,云朵中还显示着三个亮着的工牌;另一条则完整还原了面馆吃面看手机的场景,包括吸面条、手机亮起、举手机大笑竖大拇指等动作,甚至连角色的渔夫帽、黑框眼镜、印有字样的白T恤都完美保留,一致性表现出色。

这款模型支持画面、对白、音效与环境声的同步生成,这也是当前前沿视频生成模型的标配功能,H3的表现尤为稳定。比如面馆场景中,手机亮起的“叮”声精准匹配了画面的时间点,无需后期单独调整音效。

除了图片与视频参考,H3还支持音频参考功能,创作者可以上传一段音频来复刻目标音色,让生成的角色使用该音色进行对话。测试团队上传了一段13秒的口播音频,搭配自己的扁平插画形象,生成了一段15秒的开场白视频。生成的角色不仅完美还原了形象的画风与配色,还准确使用了参考音频的音色,连原录音中的环境音细节都得到了保留。对于配音创作者来说,这种方式避免了重新录制时的状态差异,只需输入台词就能获得与原录音一致的音色,大幅降低了后期配音的成本。

以图中的扁平插画风格角色为主角,保持画风和配色。多镜头快节奏开场:镜头1(0-3秒)从工作室窗外夜景快速推进穿过窗户,冲向坐在书桌前的角色;镜头2(3-11秒)角色对镜头说话,镜头围绕角色做明显的弧线环绕运镜;镜头3(11-15秒)快速拉远变焦,角色比出一个手势定格。角色的声音使用参考音频的音色,自然说出台词:「大家好,我是创作者。这期视频,我们让AI来打个工,看看它一天能干多少活。」口型与台词同步。运镜要快、幅度要大。音频:角色说话声为主,镜头切换处有轻快的whoosh音效。

3. 真人素材生成无限制

不少视频生成模型对真人素材存在限制,上传真人图片后经常出现报错或面部崩坏的问题,这让真人短剧、广告等创作场景受到了不少限制。而H3对真人素材的支持更为友好,测试团队使用一张AI生成的写实风格女性开球照片作为参考,要求模型将角色从投手转换为击球手并打出全垒打,生成15秒的体育短片。

15秒体育短片,真实比赛影像质感,以图中的年轻女性为主角,保持她的长相、发型和白色棒球衫百褶裙造型完全一致。夜场棒球场,她站在打击区摆好击球姿势。投手投出快球,她果断挥棒,木棒清脆击球,球划出高高的弧线越过全垒打墙,全场观众起立欢呼、手机闪光灯如星海。她兴奋地丢开球棒,举起双臂沿垒道奔跑庆祝,队友在本垒板迎接她跳起击掌。动作符合真实棒球物理,她的脸部全程保持一致清晰。音频:球场欢呼声浪、击球的清脆木声、广播激动的呐喊。

两次生成的结果都完整还原了角色的外貌、发型与棒球服造型,完整展示了挥棒、球飞出全垒打墙、队友庆祝的全过程,面部细节始终保持清晰。其中第二次生成的版本还准确还原了“丢下球棒”与“队友在本垒板列队迎接”的细节,完成度非常高。

4. 模型的能力边界

经过近一天的测试,团队总结了H3的几个明显局限:一是无法完成跨场景的硬切镜头,当要求两个场景直接切换时,模型往往会将两个场景融合为一个;二是无法严格执行精确到秒的音效点位,测试中要求的四个定时音效,仅两个准确按时响起;三是无法实现多段文字的时序弹出,虽然中文花字的生成质量出色,甚至能自动添加综艺感的强调线,但无法按照要求依次弹出多段文字。

查阅模型发布的技术文档后可以发现,H3的设计思路是将此前分散的文生视频、图生视频、视频编辑、主体参考、动作参考等功能整合到统一的自然语言上下文语境中,用户只需用自然语言描述参考素材与生成需求,模型就能准确理解并执行。其2K分辨率的生成并非通过传统的超分放大,而是基于原始上下文重新生成高清结果,因此小字等细节都是通过重绘实现的,而非简单放大。而精确的时序控制并非此次版本的优化目标,因此在这方面存在一定局限。

基于这些特点,H3的最佳使用方式是单次生成仅明确单个场景或状态的需求,跨镜头的叙事可以通过后期剪辑完成。由于生成成本极低,多生成几条素材再进行拼接,反而比要求模型一次性完成复杂叙事更高效。

5. 使用流程与行业价值判断

这款模型可通过专业AI创作平台直接访问,完整的使用流程非常简单:打开平台官网,点击「开始创作」进入创作画布,添加视频节点并选择H3模型;如果需要使用参考素材,只需将图片、音频或视频文件拖拽到画布中,连接到视频节点即可完成参考绑定;输入生成提示词后,在右下角设置比例、分辨率、时长与生成数量,点击生成即可,通常两分钟左右就能获得成片,直接在节点上下载即可。

视频生成模型的竞争此前更多集中在生成能力的提升上,而H3的上线标志着行业竞争开始转向成本与易用性。当一条2K分辨率的视频仅需3元时,创作者是否使用AI来补全镜头,不再需要进行成本计算。测试团队在剪辑视频时,从发现素材缺口到完成生成并使用,整个过程仅用了十分钟,大幅提升了创作效率。

以上内容不代表本平台立场,仅供读者参考