PixVerse R2:让虚拟世界真正“活”起来,互动娱乐迎来新范式

近两年,互动娱乐的热潮率先在线下掀起。比如河南开封的万岁山武侠城,如今不少游客到访早已不只是为了景点和常规演出。有人专程找到景区的NPC猜拳、接任务、兑换虚拟道具,还有人刷到某位NPC的互动短视频后,直接奔赴景区当面体验。据了解,景区目前拥有近2000名NPC,每天上演上千场互动内容,不少游客会因为没完成的任务、没遇到的角色特意二刷甚至三刷景区。
这类体验走红的原因不难理解:常规的线下表演,观众在家刷手机就能了解大致剧情,现场观看也只是图个视觉效果。但和NPC互动完全不同,每一次交流都是亲身参与的,灵活的NPC还能临场发挥、随机抛出精彩台词,这样的体验往往让人记忆深刻。
这也印证了一个趋势:互动式娱乐的市场正迎来爆发式增长。
线下互动娱乐的火热已经足够亮眼,线上的互动玩法更值得期待。我们注意到的是,PixVerse(爱诗科技)在这一领域早有布局。今年1月,该公司推出了业内首个实时视频世界模型PixVerse R1,玩法极具新鲜感:用户输入一句指令,视频内容就会根据提示实时变化,让使用者体验到类似造物主的创作乐趣。
当时,这款产品在海外社交平台引发广泛关注,有观点认为这是一场全新的注意力争夺战的开端。正如万岁山的互动场景一样,这种沉浸式互动玩法让早已厌倦静态、被动娱乐方式的用户重新兴奋起来,注意力被重新分配,线上互动式娱乐的爆发节点正在到来。
看准这一赛道的PixVerse并未停下脚步,如今,这款实时生成与交互的核心底座——实时世界模型已经完成全面进化,来到了R2版本。
在这个版本中,用户终于可以真正和一个虚拟世界进行持续交互,这个世界能够稳定运行,成为一个真正可以“玩起来”的系统。它不仅解决了实时视频世界模型如何持续规模化发展的问题,也让世界模型首次拥有了走出实验室、直面普通用户的落地形态。
R1发布时,最吸引人的点在于“实时响应”,它通过即时的反馈给用户带来了类似变魔术的新奇体验。但如果一个世界想要真正“玩下去”,仅仅能响应单次指令远远不够,这种玩法只能带来一时的新鲜感,很容易让用户感到厌倦。要打造一个可以持续互动的世界,需要解决诸多复杂问题:用户如何与世界对话?多模态输入能否真正生效?系统延迟是否能满足交互需求?用户新增的剧情内容,系统该如何承接?世界如何保持稳定运行,长时间不出现逻辑漏洞?
从官方公布的几段内测案例中,我们可以看到这些问题已经有了初步的解决方案。
第一个案例类似实时生成的潜入游戏:角色正在躲避追兵,玩家一边通过WASD按键控制行动方向,一边用文字直接改写当前局面。比如输入“增加障碍物阻止追兵”,路面会立刻滚出油桶;要求开启秘密路线,角色附近的墙壁会出现一道石门;进入隧道遭遇巡逻兵后,玩家可以让角色换上巡逻兵制服,混入人群继续前进。
这个设计的直观亮点在于,不同类型的控制方式被整合进了同一场体验中:方向键负责控制行动路径,自然语言指令负责调整世界走向,两种输入同时生效,画面都会实时响应。而且剧情逻辑依然保持合理,比如角色换上巡逻兵制服后,旁边的NPC会自然无视他的存在。
第二个案例则更能体现R2在玩法自由度和全局控制之间的平衡。玩家原本在一个古风世界中行进,中途突然输入“召唤一只老虎坐骑”,一只风格匹配场景的巨型老虎就会出现在面前;接着输入“骑上去”,角色便会骑虎继续赶路。更有意思的是,这个临时加入的创意并没有打断原本的游戏流程:玩家继续来到断桥处,自然进入剧情选择环节,随后骑着老虎越过断桥、选择武器,故事依然流畅推进。
这是实时生成技术的关键突破:玩家可以跳出预设剧本,但世界依然能将剧情承接回来。过去游戏中的自由度,往往依赖开发者提前准备大量分支剧情;而这里则提供了另一种可能——核心主线依然存在,但主线之间的过程可以临场生成。玩家突然想要骑老虎、绕路前行,未必需要开发者提前制作好完整的对应内容。
另外几段案例展示了另一种互动形式:直接和角色对话。一个三星堆面具形象的角色可以读懂玩家的提问,并用方言实时回答,说话时面部表情也会同步变化;还有一段数字人直播场景中,观众可以在主播讲话过程中直接输入文字插话,主播会迅速接住话题并自然转换讨论方向。
此外,数字人对话还支持实时语音插话,也就是语音输入和输出同时进行,画面中的人物对答自然流畅,几乎感受不到明显的等待延迟。
这些案例看起来没有那么强的戏剧冲突,但对互动娱乐而言同样至关重要。真正自然的交互,不能每次都经历“输入—等待—生成—播放”的明显回合制流程。只有响应速度足够快,用户才能忽略背后的技术模型,将注意力完全放在角色和世界本身。
所以在这些案例中,R2已经不只是让视频“听话”。玩家可以通过按键控制行动,也可以随时用文字或语音插入新的想法;世界需要立刻做出反馈,同时还要继续沿着原本的逻辑运行。要实现这样自然的体验,需要扎实的技术支撑。
看完这些体验案例,我们自然会好奇:这样的世界模型该如何承载这些需求?它既要具备生成模型的表现力,又要像持续运行的系统一样处理输入、更新状态,还要将延迟控制在自然交互的范围内。而这些需求往往是相互矛盾的。
过去行业内的常规做法是将链路拆解得越来越细:先将双向模型改为自回归模型,再为各个子任务单独训练教师模型,随后进行少步蒸馏,最后还要用模型生成的历史内容回头修正偏差。整套流程下来有五六道工序,每经过一道环节,上游积累的画质、控制能力和稳定性都会出现折损,就像传话游戏一样,经过多人传递后原意早已失真。
R2反其道而行之,将整条流水线简化为两个核心步骤:首先,持续预训练一个统一的Omni Causal AR模型,将生成质量、长程一致性、多模态控制能力整合到同一个模型中进行训练;其次,从已经稳定运行的大模型中直接蒸馏出实时模型,也就是Real-Time Acceleration,将模型能力尽可能无损地加速到可交互的实时运行区间。省去了中间环节的反复迁移,新数据、新任务、新控制信号都可以进入同一条训练主线,这堪称世界模型训练范式的一次重构。
Omni Causal AR:先把世界的能力上限养大
Omni Causal AR作为核心底座,负责将所有输入类型——文本、参考内容、语音、WASD按键操作等——整合到同一个模型中,输出时间同步的音视频流,并且可以在运行过程中实时接收新的输入。听起来逻辑顺畅,但要让这个模型在更长的时间尺度上保持稳定,预训练阶段需要解决多个关键难题。
第一个难题是不同控制信号的时间尺度差异巨大:按下方向键需要立刻得到反馈,而输入一段剧情指令可能描述的是持续数秒的完整事件。如果模型用固定长度的时间单元切割音视频,只能在响应速度和内容完整性之间二选一。R2的解决方案是Dynamic Chunk,根据控制信号的语义边界自适应切割:操作指令到来时切割得更短,保证响应精度;事件指令到来时切割得更长,确保内容结构完整。这种设计还有一个额外好处:不同类型的任务和数据都可以通过同一套因果生成接口进入同一个训练过程,为后续的持续规模化发展预留了空间。
第二个难题更隐蔽:训练时模型读取的历史都是干净的真实数据,但实际运行时,模型读取的是自己上一轮生成的历史内容,其中必然带有噪声和微小误差。只接触过干净历史的模型,单步生成质量可能很高,但无法应对自身的小失误,一个微小的偏差就可能被不断放大。R2的解决方法是在训练中加入带噪的历史数据,也就是Hybrid Teacher / Diffusion Forcing,让模型提前适应不完美的自身状态。同时配合Causal Attention Mask限制当前状态可读取的历史范围,用相对时间编码管理历史在窗口中的位置,缩小训练和实际运行的差距,让模型在历史内容出现轻微偏差时也能稳定继续运行。
第三个难题是记忆管理:长期运行的世界不可能记住所有历史,算力无法支撑;但如果裁剪过多的历史内容,就会丢失角色身份、场景细节、之前发生的事件等关键信息。R2的方案是将记忆分为三层管理:Sink Memory负责保存角色、场景、世界规则等长期锚点,保证世界始终保持一致性;Rolling History追踪最近的动作、姿态和镜头,确保眼前的状态自然衔接;Object KV Cache对对象级的历史进行压缩复用,只保留真正影响后续演化的内容。通过分层管理,在固定算力预算内,既保证了长期身份的一致性,又维持了短程状态的连续性。
第四个难题是错误本身:AR世界模型的严重漂移往往源于一个不起眼的小错误,早期的一个小失误被写入历史后,后续每一帧都会将其作为事实继承,最终错误不断放大。R2专门为这类错误建立了Error Bank,可以理解为模型的错题本,将有代表性的错误历史整理为训练样本,在训练时按比例回放,让模型反复练习如何从出错的状态中恢复。这个机制的效果可以通过数据体现:长期亮度漂移指标从0.201降至0.129,下降了约35.8%;在29个长序列测试样本中,20个样本的表现得到改善,5个明确无动作的样本中,错误运动完全消除。
Real-Time Acceleration:再把能力加速到实时区间
在完成了稳定运行的世界模型构建后,接下来需要将其加速到实时交互的区间。这里最关键的决策是统一起点:教师模型和学生模型的初始化、实际的自回归推理,都从同一个Omni Causal AR模型出发。这样一来,少步模型无需从头学习世界规则,蒸馏过程也从“重新学习”变成了“少步加速”,之前训练得到的生成质量、控制能力和长程状态转移能力都可以直接继承。
具体的加速通过三个手段实现,分别控制不同维度的成本:
第一,DDMD with Adversarial Regularization负责保障蒸馏质量。少步生成中有两个天然冲突的目标:一方面需要准确响应各类输入,另一方面需要维持画面的真实感,用单一信号优化很容易顾此失彼。R2将条件对齐、分布匹配、对抗正则三类信号分开构建,最后整合到同一个学生模型中,既保证了控制强度,又保留了画面真实感。
第二,Block-sparse Attention减少长上下文的计算量。模型按块估算相关性,只保留得分最高的一小部分关键连接进行精确计算,其余部分直接跳过。将注意力稀疏度提升至90%以上,在评测中画面质量、指令遵循度等指标并未出现明显退化,节省的算力预算转化为更低的延迟。
第三,Pyramid Ultra-few-step Distillation解决高分辨率场景的成本问题。与其让全部计算都在高分辨率空间中进行,不如先在低分辨率阶段确定场景布局、主体运动和镜头结构,再通过极少的高分辨率步骤补充纹理和细节,将粗加工和精加工分开,减少重复计算。
综合来看,R2的核心思路非常清晰:上层专注于将世界的能力上限提升,下层专注于将这份能力尽可能无损地加速到实时交互区间,中间避免了能力在迁移过程中的折损。那些看似相互矛盾的需求,都通过这种两步式的架构分别得到了解决。R1证明了实时视频世界模型的范式是可行的,而R2则给出了该范式持续规模化发展的方法。一个可以持续游玩的虚拟世界,正是通过这样的技术底座搭建起来的。
互动式娱乐的独特魅力,早在20多年前就被前任任天堂CEO岩田聪指出:“以电子游戏为代表的互动式娱乐的强大之处在于,即便过了十年甚至十五年,玩过的游戏仍然会留在记忆之中。小说、电影虽然也会让人感动,但经常只记得当时确实感动过,连剧情梗概都说不出来了。然而,游戏是亲身操作、具有参与性的娱乐形式,触动人的方式非常独特,这是游戏的强大之处。”互动的核心在于有输入、有反馈,每一次体验都可能出现细微变化,用户的行动本身也参与构成了内容。
过去,游戏等娱乐形式已经将这套互动机制发展得非常成熟,但游戏中的绝大多数可能性都需要提前由开发者制作完成。互动更多是在固定内容中设计分支,即便分支设计得再密集,玩家也只能在预设的剧本中选择一条路径,这让自由始终存在天花板,通关之后,虚拟世界就会被彻底掏空。
而世界模型的加入,让这条边界有机会继续向外拓展。未来,创作者可以先定义世界观、角色、规则、视觉风格和核心剧情,再让部分具体内容在互动发生的那一刻实时生成。
在快速升温的世界模型赛道中,PixVerse(爱诗科技)是较早押注实时视频生成,并尝试将其打造为面向普通用户的互动娱乐产品的厂商之一。
R2本次展示的三个方向——世界探索、剧情互动、实时角色——分别对应着互动娱乐的三个基础组成部分:可供行动的空间、推动剧情发展的叙事逻辑、能够回应玩家的角色。当这三个部分越来越多地由同一个实时世界模型驱动时,游戏、互动影视、数字人甚至线下文旅之间原本清晰的边界可能会逐渐模糊,娱乐产品的生命周期和商业空间也将被重新定义。
我们在评论区放上了R2的体验预约链接,感兴趣的读者可以提前预约,待后续体验开放后获取邀请资格。开发者也可以通过同一入口关注API开放的相关信息。

