你的选择决定AI互动影游的下一幕

过去两年,AI视频赛道的竞争核心是生成质量;而近两周以来,行业竞速的焦点已经转向推理速度与实时交互能力。MiniMax H3后训练视频模型的实时交互能力升级、GPT-6与Claude Fable 5.1的新一代模型突破,在同一时间节点集中落地,这让AI应用与模型行业迎来了全新的发展机遇:视频不再是内容的终点,正在逐渐成为互动娱乐的基础设施。
AI模型的竞速:从质量到实时性
当前AI模型领域的竞争正在加速缩圈,Anthropic与OpenAI先后推出了Claude Fable 5.1与GPT-6 Astra,GPT-6官方将其定义为计算机使用、软件工程等方向的代际跨越,通用人工智能的门槛似乎正在逐步降低。依托这些能力升级,不少团队开始尝试Blender建模与3D游戏开发,AI生成的游戏玩法首次接近可直接使用的水准,代码与3D素材也被纳入了新一代视频生成技术方案中。
在多模态模型领域,MiniMax在8月初开放了H3的模型权重。这款330亿参数的稠密视频模型,可以在同一个上下文里处理文本、图像、视频与音频,生成的视频还自带原生对白、音效与配乐。开源H3的核心价值并非模型本身的性能,而是将“后训练”的主动权交给了整个社区:LoRA微调、模型蒸馏、量化压缩、稀疏注意力优化,短短一个月内就有数十个团队基于这个底座进行加速与定制化训练。
其中进展最快的是推理基础设施服务商fal,他们先针对H3模型进行了定制化后训练,再将优化后的模型部署到自家的推理引擎中,推出了H3 Max版本:可以在3秒内生成768p分辨率、带原生音频的5秒视频片段,同时生成成本也得到了大幅降低。
社区的响应速度甚至超过了fal团队。短短几天内,就有开发者打造出了无限循环的短视频流、基于RSS和社区讨论驱动的24小时AI新闻台、实时你画我猜游戏、约会模拟器以及分支式文字冒险作品。这些作品大多还比较粗糙,但它们验证了一个核心逻辑:当视频生成速度超过播放速度时,视频就不再是预先制作完成的内容,而是可以被实时定义和生成的互动载体。
有行业从业者也敏锐捕捉到了这个趋势,Manus联合创始人张涛就在社交平台上发文强调:“下一个应用爆发的节点,就是延迟控制在1秒以内的实时互动视频技术成熟之时。这个观点我两个月前就提出过,如今终于迎来了落地的窗口。”
行业的实际落地比理论预判更快,除了社区开发者,不少专注于AI互动内容的公司已经提前布局。其中,AI互动内容厂商Yoroll近期推出了基于H3的定制化后训练模型Yoroll H3 Superfast,该模型可以在4秒内生成10秒的768p分辨率、24帧带原生音频的视频,比实时播放速度快2.5倍。依托这个模型,Yoroll同时上线了实时叙事互动产品YoLive。
在推出新模型和新产品之前,Yoroll及其平台上的创作者已经取得了不少亮眼的成绩:《丧尸清道夫》与《民国诡事》的Steam心愿单均超过5万;女性向互动游戏《华君传:翻牌吧女帝》上线抖音小游戏仅一个月,玩家数量就突破了200万;还有一位北美创作者仅用两天时间、花费约250美元,就打造出了包含140多段视频、11个结局的竖屏互动影游《AI Odyssey》,这款作品上线后一度冲上美国社交平台趋势榜首位。
从“快过实时”到“可玩可用”:实时互动视频的落地实践
Yoroll H3 Superfast的官方定位非常明确:“专为游戏打造,而非仅仅服务于影视内容”。这款基于开源H3模型进行后训练和推理加速的版本,可以在8张B200显卡的环境下,用4秒生成10秒的768p分辨率、24帧带原生音频的视频,生成速度比实时播放快2.5倍。作为对比,fal的H3 Max版本可以在3秒内生成5秒的视频片段,实时速度比约为1.7倍。目前Yoroll H3 Superfast已经在Yoroll创作者平台正式上线。
依托这款新模型,Yoroll同时推出了互动产品YoLive,其核心形态是一款由社区共同参与、持续迭代的互动剧情游戏。
用户进入YoLive后,看到的是一个持续播放的AI互动剧情直播频道。任何观众都可以提出下一幕的剧情方向,比如让角色跳舞、安排天台追逐戏、加入意想不到的反转剧情,其他观众可以为这些提议投票,得票最高的方案会被系统结合当前已有的剧情、人物关系、场景状态和任务进度,实时生成新的视频内容。首个开放的互动频道来自《丧尸清道夫》:机器人牛仔、模特、鸵鸟以及原子朋克风格的废土世界构成了稳定的世界观框架,观众可以共同决定故事的发展走向。
这也让弹幕第一次拥有了实际的参与价值:过去观众只是在作品下方聊天,如今聊天内容直接成为了作品的一部分。有人关注角色的命运走向,有人希望通过剧情制造笑点,还有人专门尝试把故事引向意想不到的方向,这些不同的想法碰撞在一起,共同构成了下一幕的创作素材,也成为了观众留在直播间的核心动力。对于参与其中的用户来说,最有成就感的时刻莫过于“刚才的提议被选中了”。
比YoLive更能体现“实时生成作为核心玩法”的,是Yoroll平台上创作者正在开发的一批互动小游戏。这些作品的共同特点是:使用Yoroll Code编写游戏玩法逻辑,通过H3 Superfast的API实时生成游戏画面,用户的实时输入可以直接改变剧情走向。目前这些作品还处于开发探索阶段,但已经展现出了清晰的创作方向。
在这些小游戏中,“实时生成”已经被深度融入到交互设计中:《相亲战士》允许玩家按照自己的喜好定制相亲对象,通过自由对话和行动推进约会进程,一句试探的话语、一个大胆的举动,都可能让剧情走向完全不同的分支;《主播开箱模拟器》将直播间弹幕转化为送礼指令,观众可以决定箱子里的物品,AI则实时生成开箱过程和主播的反应,惊喜还是惊吓完全由观众决定;《火柴无限冒险》则让玩家自由决定纸上火柴人的行动,玩家可以选择新的身份、构思出人意料的脱身方案,甚至提出预设选项之外的想法,AI再将这些创意转化为新的画面和剧情。实时生成最核心的变化,就是将玩家的想法直接转化为游戏中即将发生的内容。
这些游戏的体量都不算大,但它们是行业内首批真正将“下一幕由玩家输入决定”作为核心玩法循环的作品,而非仅仅作为宣传噱头。
AI互动内容的用户吸引力:数据与体验验证
Yoroll并非在实时生成技术成熟后才进入这个赛道,反而早在几年前就已经布局AI互动内容领域。他们的小游戏产品已经通过玩家数据验证了市场需求,大型AI游戏也已经达到了精品水准,不少头部创作者也已经入驻平台。无论采用实时生成还是预生成技术,用户和玩家最关心的始终是优质的故事、有趣的玩法和令人上瘾的互动体验。
Yoroll平台上的首批创作者作品《华君传:翻牌吧女帝》是一款女性向互动内容,8月上线抖音小游戏后,仅用一个月时间就积累了200万玩家,成为目前已知的玩家规模最大的AI互动影游之一。
在海外,一位北美创作者在Yoroll平台上仅用两天时间、花费约250美元,就打造出了包含140多段视频、11个结局的竖屏互动影游《AI Odyssey》,这款作品上线了Yoroll平台和TikTok Minis小游戏。恰逢诺兰《奥德赛》电影上映的热度,该作品一度冲上美国社交平台趋势榜首位。
在大型游戏领域,Yoroll也带着多款头部AI作品进入了传统游戏工作室的领地。在德国科隆举办的全球最大游戏展gamescom上,Yoroll的展台前,不少玩家最初以为只是观看一部AI制作的短片——毕竟《丧尸清道夫》本身就是一部广为传播的AI短片。但实际试玩后玩家发现,游戏的结构比Steam页面披露的要复杂得多:除了互动影游常见的选项和QTE快速反应环节,还包含场景探索、第三人称射击和放置塔防玩法。玩家操控机器人男主进入海滩清理丧尸,进入地铁站后视野骤然收窄,尸潮从四面八方涌来;操作段落结束后,会切换到电影化叙事环节,玩家的背包、武器、角色数值等状态会被保留并带入后续剧情。这款90分钟的实机试玩版,在科隆游戏展的试玩数据中,玩家平均体验时长超过半小时。不少海外玩家的第一反应是,一款看起来像是AI电影的作品,竟然真的可以进行空间移动、探索和射击,这也证明了AI内容同样可以打动硬核游戏玩家。
这些游戏背后的玩法系统和创作工具,已经整合为Yoroll的核心平台能力。随着AI视频生成质量不断提升、游戏玩法编程门槛持续降低、实时生成速度越来越快,AI互动娱乐产品的爆发期已经近在眼前。
开源底座的价值:拉平模型门槛,拉开能力差距
如果把视角放得更长远,我们可以看到大语言模型领域已经形成了“两超多强”的格局:GPT和Claude两家闭源模型领跑市场,其余的头部玩家几乎都采用开源路线,比如DeepSeek、Qwen、GLM、Kimi K3等。这些开源的头部模型并没有在通用基准测试中胜出,却在应用层取得了巨大优势:更低的使用成本、更开放的生态(不会面临封号或并发限制),以及可以针对自身应用场景定制优化的能力。视频模型领域则呈现“一超多强”的格局,多数头部玩家都来自国内,且过去几乎都采用闭源路线。H3模型开源后的一个月里发生的变化,和DeepSeek开源后半年内大语言模型应用层的发展非常相似:基于同一个底座,通过LoRA微调、模型蒸馏、量化压缩、稀疏注意力优化等技术,涌现出了多个定制化版本,模型本身已经不再是稀缺资源。
开源确实拉平了模型层的竞争起跑线,但有三个核心要素并没有被拉平:推理优化栈、专属训练数据和产品落地能力。
fal的核心优势在于推理栈和开发者生态。作为一家专注于推理基础设施的公司,H3 Max版本的快速生成能力,一方面来自针对模型的定制化后训练,另一方面则得益于将优化后的模型部署到自家的推理引擎中。fal已经将“比实时更快”的视频生成能力打造为公共服务,任何开发者都可以按使用时长付费获取。
Yoroll的核心优势则在于专属数据和产品落地能力,这也是他们选择定制化开发自有模型版本的核心原因。首先是专属训练数据。从涉足互动影游和3D游戏领域的第一天起,Yoroll就开始积累一类其他团队没有的素材:游戏内影像。无论是第一方的长内容作品,还是创作者平台上的用户生成内容,都留下了大量带有分支剧情、状态标注和玩法逻辑的镜头数据——比如什么样的画面应该接在哪个选择之后,一个角色如何在90分钟的剧情中保持行为一致,射击环节和叙事段落之间如何自然衔接。通用视频模型的训练数据大多来自电影和短视频,擅长“拍摄”却不擅长“互动”。H3 Superfast的后训练过程,就是用游戏内数据来弥补这个短板:优化游戏美术风格的稳定性、长序列中的角色一致性、镜头和玩法节奏的配合,以及为世界模型预留动作控制接口,让模型可以根据玩家的操作而非仅仅文字提示来生成后续画面。
其次是产品落地能力。速度只有被实际使用才能体现价值。Yoroll H3 Superfast发布当天,就已经在三个场景中投入使用:创作者平台的视频生成、YoLive的实时剧情生成,以及实时互动小游戏的画面生成。每一次速度提升都直接落地到玩家体验中,而玩家的反馈又可以反过来帮助模型团队优化产品:比如角色动作未按预期执行、道具前后状态不一致、画面衔接不自然等问题。只专注于模型开发的公司很难获取这类用户反馈数据,而只做应用的公司过去又无法获取定制化的模型能力;开源模式解决了后者的问题,但前者的C端产品落地能力仍然需要自建。
最后是推理优化栈。实时生成技术的更大难点其实在于推理优化和加速。Anthropic曾计划以60亿美元收购AI互动视频公司Decart,很大程度上就是看中了该团队在推理优化领域的能力和积累。据了解,Yoroll的母公司LinearGame正在洽谈投资一家AI推理芯片公司,双方将进行深度合作,通过软硬件协同优化,依托“云+端”的专用芯片进一步落地实时推理生成技术,解决当前的速度和成本问题。开源的模型底座会随着技术迭代不断更新换代,但数据积累、产品能力和推理栈优化这三样东西,才是这一轮竞争中真正可以长期积累的核心竞争力。
未来的互动内容形态:预生成与实时生成的融合
未来的互动娱乐内容,将是预生成与实时生成的融合形态:预生成环节负责打磨核心内容,比如主线剧情、角色设定和关键场景;而玩家未被预设的提问和行动,则由实时生成技术来承接。一套完善的规则和状态系统需要记录所有已发生的剧情,保证故事和玩法的连贯性。
成本结构将决定两者的具体分工:多人共同观看、共同参与的实时直播流更容易分摊生成成本;个性化的单人互动内容则需要用户具备一定的付费意愿;而可以自由探索的持久虚拟世界,则有待控制能力和推理成本的进一步优化。
互动作品也可以采用边运营、边迭代的模式:先交付核心主线内容,再将玩家感兴趣的角色、场景和互动玩法打磨为后续的更新内容。
长期来看,AI互动娱乐的核心竞争力来自内容与IP储备、交互数据积累、创作工具开发、发行能力和推理成本控制。Yoroll已经在这些方向上进行了长期布局,但归根结底,任何一款产品都需要回答一个核心问题:它是否足够好玩,是否能让用户愿意花费时间,是否能让用户愿意为体验付费。
下一幕的故事,就从你的一个弹幕选择开始。
参考资料
[1]yo.live:http://yo.live/

