文章摘要
PixVerse研发团队即将推出新一代交互式世界模型PixVerseR2。该团队从AI视频生成领域起步,今年年初推出全球首个实时世界模型R1,但它存在剧情割裂等问题。R2针对这些痛点进行开发,内测Demo显示其连贯性显著提升。技术上,R2重构开发流程,还调整训练方式、重新设计记忆模块,探索成果或成互动娱乐领域底层设施。

PixVerse的研发团队即将推出新一代交互式世界模型PixVerse R2,这家从AI视频生成领域起步的创业公司,其探索方向始终充满新意,从早期的AI内容工具到如今的实时互动世界构建,每一步都在拓展AI生成内容的边界。

团队最初的创业方向是大众熟知的AI视频生成,这个阶段的核心目标是根据用户的文字描述生成对应的视频内容,行业普遍的追求方向包括提升视频画质、增强内容可控性、优化画面连续性以及完善分镜设计等。这些方向本身极具价值,但这家团队并没有止步于此,很快提出了一个更具想象力的构想:如果AI生成的不再是一段静态的视频,而是一个持续运行、用户可以深度参与的完整世界呢?

很多人都有过类似的想象,比如在传统网游中,如果遇到一伙土匪,通常只能按照开发者提前编排好的剧情互动,要么只是机械重复台词,要么只能完成预设的任务选项,无法真正按照自己的想法改变局面。但如果是一个由AI实时生成的世界,一切就会完全不同:你可以走上前去和土匪交谈,询问他们落草为寇的原因,甚至可以花钱收买他们、一起行动,或是劝说他们解散队伍,每一个选择都会推动世界朝着不同的方向发展。

这正是PixVerse R系列模型正在探索的方向。今年年初,团队推出了R1模型,这也是全球首个实时世界模型。它可以持续生成一个完整的虚拟世界,用户可以随时介入其中,通过控制设备调整视角和角色移动,也可以直接通过自然语言输入指令,实时改变画面内容。比如当角色正在雪地里行走时,你可以告诉模型前方出现一座废弃的城堡,生成的画面就会顺着这个指令继续推进。

不过R1并不成熟,最明显的问题在于,虽然可以实时改变画面内容,但后续的故事线和场景很难保持连贯。比如刚才的雪地城堡场景,当你进入城堡后,之前的角色状态、场景逻辑往往无法延续,很容易出现剧情割裂的情况,甚至随着运行时间变长,还会出现人物变形、场景漂移等问题。

即将推出的R2正是为了解决这些痛点而开发的。从目前放出的内测Demo来看,R2在连贯性上有了显著提升。比如在一个基础的场景中,玩家可以通过WASD快捷键操控角色移动,中途输入“增加障碍物”的指令,新的障碍会自然衔接到当前的场景中;再输入“开启秘密路线”,模型也会顺着之前的逻辑继续生成内容,不会突然切换到完全无关的画面。

类似的效果在仙侠场景中也有所体现,当玩家中途输入“开启南天门”的指令后,模型会沿着之前的场景继续生成,人物和环境都能保持高度一致,没有出现R1中常见的连贯性断裂问题。还有一个更贴近实际应用的直播场景Demo,主播一直在围绕猫粮和喂养问题进行讲解,当观众提问“越胖的猫越适合这款猫粮吗”时,主播会顺着之前正在讲解的商品内容继续回答,结合猫咪的具体情况给出建议,整个过程中人物、商品和直播间环境都能保持统一,对话逻辑也能连贯延续。

当然,R2目前还处于内测阶段,上述展示的都是团队放出的Demo内容。创业公司的迷人之处往往在于敢于探索尚未被验证的方向,而PixVerse的迭代过程正是如此。

从技术层面来看,R2做了非常重要的架构重构。实时世界模型的开发一直面临一个棘手的矛盾:既要保证画面生成质量,又要能沿着已有的内容持续推进,同时还要满足低延迟的实时交互需求,让用户操作后能快速得到反馈。

过去的开发流程通常是分开进行的:先训练基础的视频生成能力,再将模型改造为可以按照时间线持续生成内容的AR模型,也就是只能基于已发生的内容预测后续发展,之后还需要通过蒸馏和加速技术将模型轻量化,以满足实时交互的要求。这套多阶段的改造流程会让模型经历多次适配调整,原本的画质、控制能力和长期生成的稳定性都可能出现损耗,随着数据量和交互复杂度的提升,维护难度也会越来越大。

R2对这套流程进行了重构,团队首先训练了一个统一的Omni Causal AR模型,支持文字、图片、视频参考、音频以及WASD操作等多种输入形式,模型可以基于已发生的世界状态和用户当前的操作,持续生成后续的画面和音频内容,训练数据也可以从短视频扩展到长视频和多轮交互场景。等基础的世界模型训练完成后,再通过Real-Time Acceleration技术将模型能力完整迁移到低延迟的实时运行版本中。

这种统一的训练框架让后续模型扩容、新增数据和交互方式都更加顺畅,解决了实时世界模型的规模化发展难题。同时,R2还对AR模型的训练方式进行了调整,在训练过程中不仅会学习正常的历史数据,还会加入一些带有轻微误差的历史样本,这样在实际运行时,即使前期出现了一些小偏差,模型也能继续稳定生成内容,不会越走越偏。

另外,R2的记忆模块也进行了重新设计,将需要长期保留的信息比如角色身份、场景设定单独存储,而近期发生的动作和环境变化则保留在短期记忆中,这样既不需要存储全部历史数据,又能最大程度维持前后状态的一致性。

就像回看二战历史中的珍珠港事件,今天我们当然知道事件的后续发展,但回到1941年,当时的决策者面对的是充满不确定性的信息,只能基于手中掌握的线索做出判断。如今的AI领域同样处于类似的早期阶段,具身智能、世界模型等新兴方向,大家都清楚大致的发展目标,但具体的落地路径还远未形成统一的共识,各家公司都在按照自己的理解摸索前进。

很多年后回头看,或许某条技术路线会被证明是最自然的选择,但站在当下,世界模型的具体实现路径还没有明确的答案。PixVerse选择从熟悉的视频生成领域切入,先用R1验证实时生成和交互的可行性,再用R2解决世界的持续性和模型规模化问题,这条路线的最终成果尚未可知,但他们持续迭代的探索本身就极具价值。如果未来游戏、互动影视、虚拟角色等领域都逐渐转向实时生成内容,那么今天这些看起来还略显粗糙的世界模型,或许会慢慢成为互动娱乐领域的底层基础设施。

以上内容不代表本平台立场,仅供读者参考