MiniMax H3:AI视频视觉包装新标杆,开源赋能行业

沉寂了半年的AI视频赛道,终于迎来了新的突破。此前被Seedance 2.0长期压制的行业格局,终于有了新的变量——MiniMax正式推出了自研的H3 AI视频模型,并且宣布将对该模型进行开源。
过去半年里,AI视频行业的应用端呈现爆发式增长,但新的模型却寥寥无几,Seedance 2.0始终占据着行业头部的位置,成为不少从业者绕不开的标杆,也让行业开始思考:究竟有没有团队能打破这种一家独大的局面?
H3的出现,恰好给出了一个极具差异化的答案。和Seedance 2.0侧重影视前期创作、主打特效场景不同,H3精准切入了视觉包装与后期特效的赛道,这恰恰是过往AI视频模型的薄弱环节,也让它找到了极具商业价值的发展路径。
这款模型的能力覆盖范围相当广泛:你可以让它直接生成带歌词的动态MV,也可以上传几张平面海报,让它自动将排版、文字和视觉元素转化为动态视觉物料;上传一堆照片,它能理解每张照片的内容,自动生成带有装饰、节奏和音效的Vlog;甚至还能制作电影片头、歌词VJ、品牌宣传物料、游戏UI动效、网页滚动效果和产品发布片等,几乎可以覆盖所有和视觉包装相关的创作需求。
作为原生多模态模型,H3的功能十分全面,支持最多12个视频、图片、音频类的参考素材。目前开放的生成规格为2K分辨率、最长15秒的视频,768P的低分辨率版本暂时还未上线。价格方面,2K画质的生成服务按秒计费,每秒收费12贝壳,换算下来一条15秒的2K视频大概需要10元左右。
除了基础的生成能力,H3还拥有动作参考、指定元素替换、背景更换、视频改写、实拍视频添加特效、绿幕抠图换背景、白模视频上色、视频续写延长、整体风格参考等常用功能,实际使用效果都相当不错。
想要体验这款模型,可以访问官方站点:https://hailuoai.com/
视觉包装,正是H3的核心优势所在。过往的AI视频模型更像是一台虚拟摄影机,能够凭空创造出完整的场景画面,但一条真正面向受众的视频,创作其实才刚刚开始:剪辑、字幕添加、片头设计、转场制作、图形文字特效等基于人类视觉语言的二次创作,此前一直是AI视频的难点。
比如综艺节目中常见的花字特效,想要通过AI生成稳定且贴合内容的文字元素,并且让文字和视频画面自然互动,过去几乎是不可能完成的任务。但H3很好地解决了这个问题,它可以精准识别文字需求,并且让文字和视频内容形成自然的互动。
举个例子,以往想要制作综艺里飞行嘉宾出场的特效画面,需要手动调整大量关键帧,流程繁琐且耗时较长;但现在只需要输入对应的提示词,H3就能生成带有氛围元素、文字互动的特效画面,虽然和顶级综艺的成品还有一定差距,但整体效果已经相当成熟,品牌风格的统一性也做得不错。
我们还通过一段详细的提示词测试了H3的MV生成能力,以下是测试使用的Prompt:
15秒,16:9横版,一镜到底。生成一支极具视觉炫技感的实验MV。
主角是一位银色寸头、穿纯黑长外套的中性歌手。摄影机始终围绕主角顺时针旋转,人物持续对镜头演唱,嘴型和身份稳定。 同一个废弃摄影棚随着摄影机旋转,依次转化为五种视觉世界:真实胶片、黑白报纸、彩色黏土、透明水下、像素游戏。每次变化都由主角动作和歌词触发,空间连续,不使用硬切。
歌词与文字: “CHANGE THE FRAME” “KEEP THE FACE” “EVERY WORLD IS MINE” 0至3秒:真实胶片摄影棚。主角抬手唱出“CHANGE THE FRAME”,手掌扫过的位置变成黑白报纸网点,文字像报纸标题一样从墙面展开。
3至6秒:摄影机继续环绕,报纸世界被主角撕开,空间变成彩色黏土。人物仍保持真人皮肤和真实脸,周围道具与地面变成手工黏土。“KEEP THE FACE”沿主角身后弯曲出现。
6至9秒:主角跺脚,黏土地面化成透明水面。摄影机与人物同时进入水下,头发、衣服和气泡符合真实水体运动,歌声保持清晰。
9至12秒:主角拍碎水面,所有水滴变成像素方块。摄影棚加载成复古三维游戏世界,人物仍为真人。“EVERY WORLD IS MINE”形成巨大的游戏关卡入口。
12至15秒:摄影机完成一整圈环绕。所有视觉世界像多层皮肤一样从空间剥落,回到最初摄影棚。主角站在原位,伸手接住一枚同时包含五种材质的小方块。
声音:原创实验电子乐,五个世界分别拥有胶片、纸张、黏土、水下和像素音色,节奏连续。
禁止切镜头、人物换脸、服装变化、世界突然跳变、额外歌词、普通蒙版转场和水下嘴型失控。
生成的成品效果相当出色,运镜流畅自然,歌词文字精准匹配,除了极小的文字细节略有瑕疵,整体视觉包装和转场过渡都十分和谐。H3的语义遵循能力极强,几乎可以精准实现用户的所有描述,这对于需要精准文字控制的视觉包装创作来说至关重要。
当然,H3也存在自身的短板:在需要超强影视张力的镜头表现上,暂时还不如Seedance 2.0,但这并不影响它在视觉包装赛道的领先优势。
除了MV制作,H3还可以应用在很多其他场景中:比如品牌LOGO的动态演绎、电商新品的宣传片、影视节目的片头、设计大会的主舞台宣传片,甚至可以为日常Vlog添加趣味动效。用户不需要复杂的动效制作、手动调整关键帧,甚至不需要打开专业的剪辑软件,只需要上传素材并描述自己的需求,就能快速生成带有专业视觉包装的成品视频。
过往的AI视频模型常常展示巨龙、战争、追车等极限画面来证明自身的上限,但真正高频、高需求的商业视频,比如品牌广告、电商素材、产品介绍、社交媒体短片、游戏PV、企业宣传片等,往往不需要过于宏大的场景,反而需要快速迭代、适配不同平台的视觉包装内容。这类内容的生产需求庞大,更新频率高,经常需要针对不同人群、平台、尺寸制作多个版本,而H3恰好匹配了这类场景的核心需求。
随着这类工具的普及,手动拉关键帧、套转场等基础执行工作的价值会进一步下降,而定义创作方向、把控审美风格、识别内容质量、维持品牌一致性的能力,会变得越来越值钱。行业从业者的价值将向上游迁移,生产能力越泛滥,判断力的价值就越高。
值得一提的是,MiniMax H3将会开源。开源模型的生命力往往在发布的那一刻才刚刚开始,后续社区会持续进行推理优化、风格微调,未来会出现更多针对垂直领域的特化版本。开源是推动行业发展的重要力量,愿意开源的团队都值得肯定,而H3的开源,无疑会为AI视频领域注入新的活力。
我们也期待能有更多开源的AI视频模型出现,这才是行业健康发展的未来。

