LibTV+MiniMax H3:AI视频生成成本与效率双提升

近期AI视频领域迎来了两个值得关注的重要进展:一方面主流大模型调用成本持续下调,另一方面MiniMax推出了新一代开源视频生成模型H3。这一变化也让我们想起了LibTV创始人陈冕在相关采访中的核心观点。
笔者在阅读相关采访时,特意摘录了一段存入备忘录:陈冕的访谈观点不仅受到行业认可,就连资深创业者王慧文都曾公开表示,陈冕已经成为新一代创业者的偶像。他曾指出:只有当Token成本足够低廉、智能能力触手可得之时,面向C端的AI应用公司才能迎来真正的爆发窗口。这个时间节点可能在两到五年之间,但创业者需要从当下就开始提前布局。不少AI赛道的参与者都对这句话深有体会——模型性能固然是核心,但对于应用厂商和普通用户来说,成本始终是无法回避的现实问题,而现在这一拐点正在快速靠近。
就在近期,GPT系列模型推出了大幅降价的调整,同时MiniMax正式发布了开源视频模型H3。从实际测试效果来看,H3的生成表现已经基本追平了Seedance 2.0,实测效果能够达到后者八成以上的水准。更关键的是,H3在保持高性能的同时,将生成成本大幅压低,在2K分辨率的场景下,单秒生成成本比之前降低了超过一半。
这无疑是AI视频领域的一则重磅消息。在过去半年里,只要是涉及AI视频创作的讨论,评论区里总会有用户提及成本问题。尽管AI视频相比传统的棚拍、演员邀约和后期剪辑已经大幅降低了门槛和开支,但对于普通创作者来说,依然存在心理阈值。正如陈冕所说,只有当成本低到用户不需要反复权衡投入产出时,行业的大众需求才能真正被彻底激发。
MiniMax H3发布之后,LibTV第一时间完成了模型接入,在同类产品中响应速度位居前列,也印证了陈冕所说的提前布局的重要性。
我们可以用一组统一的提示词来对比两款模型的表现,提示内容为:回忆童年的盛夏午后,旧院子总是被暖黄色调包裹。那个无忧无虑的小男孩正在满院子欢跑,试图追逐半空中被风卷起的一只透明塑料袋。木门框旁,满脸慈爱的奶奶正逆着温暖的光站着,温柔地呼唤他回家。瞬间的时空跨越,当年那个追逐塑料袋的小男孩,如今已是满身疲惫的成年人。他静静地站在当年同一个位置,但木门前已空无一人,院子也已荒芜。此时,一阵同样凛冽的风吹过,卷起了他的衣角。
从实际生成效果来看,两款模型的表现已经非常接近,无论是镜头切换的流畅度、背景音乐的适配还是人物神态的刻画,H3的细节处理都相当细腻,几乎已经很难感受到明显的差距。
笔者近期尝试使用LibTV搭配MiniMax H3进行短片创作,当时平台恰好推出了相关活动,2K分辨率的视频生成成本仅为每秒0.2元,整体价格非常亲民。不少用户会疑惑,既然H3本身已经自带分镜能力,为何还要借助第三方的Agent工具?其实只要实际上手制作过完整短片就能体会到,LibTV至少可以帮助创作者节省50%的创作时间。
比如上传剧本之后,LibTV会自动识别并确认镜头脚本,自动筹备相关创作素材,整个流程可以一键完成。传统的视频生成工具大多还停留在单轮Chatbot模式,用户需要手动输入单段提示词来生成对应片段,但LibTV作为视频Agent,可以掌握整个短片的完整上下文,能够先梳理清楚人物关系和剧情脉络,再将完整剧本拆解为单个镜头,自动判断每个镜头需要的人物、场景和道具,提前准备素材并调用模型完成全流程生成。
LibTV会自动生成包含画面描述、景别选择、光影氛围、音效搭配和运镜方式的完整镜头明细表,用户只需要点击右下角的一键合成按钮,就能得到可直接使用的最终提示词初稿。尽管生成的提示词未必能完全符合预期,但至少为创作者提供了可以快速迭代的基础版本,省去了过去需要手动逐个琢磨每个镜头提示词、反复在不同工具间复制粘贴的繁琐流程。
除了流程优化之外,LibTV的交互设计也更加贴合创作者的需求。比如在输入核心提示词之后,用户可以选择预设的Skill模板,这些模板封装了大量成熟的镜头创作经验,系统会基于用户的输入弹出针对性的问询窗口,进一步确认创作细节。
很多时候创作者自己也未必能完全理清创作思路,直接生成的成品往往会偏离预期,而这几轮交互式确认可以帮助用户逐步明确人物风格、画面调性和镜头节奏等关键要素,最终生成的作品也更贴近最初的设想。
笔者这次的短片创作属于临时起意,全程仅花费了半天时间。不过由于当天使用H3的用户较多,生成速度有所放缓,如果是正常峰值时段,完整制作一支短片大概只需要两小时左右。除此之外,笔者还尝试用单条提示词生成了一场大会的开场宣传片,效果同样超出预期。对于初次接触AI短片创作的用户,笔者之前整理过一份保姆级创作教程可供参考。
由于笔者购买了LibTV的月度会员,无法精确统计这次创作的单次成本,但根据积分消耗估算,整支短片的生成总成本控制在50元以内。当然,当前的版本还存在不少可以优化的空间,很多镜头还可以进一步调整细化,想要制作成正式发布的作品,还需要花费更多时间进行迭代和调整,也会产生额外的成本消耗,但这次的创作体验确实让我们看到了AI视频行业的新曙光。
一支AI视频的最终成本主要取决于三个核心要素:第一个是单次生成的基础成本,第二个是单次生成的成品可用率——哪怕单次生成价格再低,如果十次产出里只有一次可用,最终的综合成本依然很高,反之如果一次可以生成多个版本,且其中有多个可用选项,整体投入就会变得更加可控;第三个则是视频Agent工具对整个创作流程的组织和衔接能力,优秀的工具可以大幅降低创作的试错成本和时间成本。
如果AI视频的单次生成成本能够持续快速下降,将会对行业两端产生直接的积极影响。对于AI应用厂商来说,模型调用成本的降低可以为上层产品留出足够的利润空间,帮助更多优质应用落地;对于普通用户来说,价格的下探会彻底改变使用习惯,当成本低到无需刻意计算时,用户才会敢于尝试更多创作场景。
AI视频从专业创作领域向大众普及的拐点,已经越来越近了。

