破解两难!PixVerse R2让实时世界模型鱼与熊掌兼得

如今,能够实时生成的数字世界模型已经能打造出越来越逼真的虚拟空间,画面质感不断提升,交互控制也愈发精细。但当这类模型走向实时生成赛道后,想要进一步提升能力就会遇到一个难以绕开的瓶颈:模型能力越强,维持实时生成的难度就越高,整个行业已经被“既要提升能力,又要保证实时性”的增长难题困扰许久。
更棘手的是,实时世界模型还要面对一类通用的底层难题,和大语言模型相比,它很难沿着稳定路径实现持续的能力升级。不过,这个困扰行业多年的痛点,如今已经有厂商通过实际模型完成了验证,给出了破解方案——实时性和通用能力,数字世界模型可以兼顾。
推出这款模型的企业相信不少用户都有所耳闻,它就是爱诗科技。今年1月,爱诗科技就发布了首款通用实时世界模型R1,主打持续生成能力,当时就在线上引发了广泛关注。而就在近期,全新的实时世界模型PixVerse R2正式上线,一经推出就登上了相关平台的热度总榜。
这一次,PixVerse R2真正将大语言模型中“持续扩容、提升能力”的Scaling逻辑,落地到了实时世界模型当中。基于统一可扩展的世界模型框架,R2将完整的时空关系融入模型,让虚拟场景能够随着时间持续演化,前后状态保持一致,让这个数字世界真正拥有了“记忆能力”。不仅如此,R2还将文字、图像、声音、动作等多种模态统一纳入模型架构,实现边生成边响应、音画同步,让虚拟世界真正可以被精准控制。
事实上,实时世界模型长期卡在能力增长环节并不让人意外,想要进一步提升模型能力,首先要突破两道技术硬门槛。第一道门槛是视觉世界建模中绕不开的表征难题:如何统一表示和建模各类信息?
和大语言模型相比,世界模型的先天条件并不友好。大语言模型的核心是语言,而语言天然具备信息形态上的优势,可以被压缩为离散、序列化的符号系统。每个词元都是边界清晰的语义单元,海量文本可以被统一为有限符号的排列组合,训练任务也可以高度归一为“预测下一个词元”,因此数据、参数和算力都能沿着同一套框架持续扩展,资源投入可以稳定转化为能力增长,这也是大语言模型能够充分释放Scaling潜力的底层基础。
但对于世界模型来说,这套逻辑却很难行得通。图像和视频属于连续、高维且高度冗余的信息形态,色彩、光影持续变化,单帧画面就包含海量视觉变量,相邻像素和视频帧之间还存在大量重复内容。除此之外,模型还需要从原始信号中进一步提取语义、状态变化乃至物理关系,信息结构远比文本复杂。因此,视觉领域长期缺乏一套类似文本词元那样紧凑、统一且可持续扩展的表征体系,视频模型想要沿着同一路径持续升级,难度要大得多。
而如果再加上“实时”这一要求,难度还会再上一个台阶,这就是实时世界模型需要面对的第二道门槛:模型容量和实时计算预算天然存在冲突。
想要维持稳定的实时生成,每留给模型的计算窗口往往只有几十毫秒,但世界模型如果想要理解更多场景、更复杂的物理关系和更长程的时空变化,就需要更大的模型容量、更复杂的建模逻辑和更多的计算资源。这也解释了为什么过去的世界模型扩展大多停留在局部能力层面:画质、时长、场景各自独立提升,却很难形成一条稳定统一的增长曲线。
这个两难问题已经被头部模型反复验证,比如2024年某头部科技企业推出的11B参数Genie模型已经能够生成可交互的虚拟环境,但到了Genie 2,虽然场景和物理能力得到了提升,实时性却更难兼顾,想要实现实时生成往往需要通过蒸馏技术,同时还要牺牲部分画质。也就是说,对于实时世界模型来说,真正的难点从来都不是单独把模型做大,或是单独把速度提快,而是让通用能力和实时运行同时成立。
想要同时实现实时性和通用能力的提升,首先要解决一个核心问题:如何让更多的数据、任务和交互信号持续融入同一套能力体系?
大语言模型能够持续Scaling的重要前提,是语言拥有相对统一的词元表示和序列建模方式,但实时世界模型面对的不仅有视觉信息,还有动作、音频、不同时长的时间尺度以及不断接入的各类控制信号。这些信息的数据形态、时间粒度和作用方式各不相同,想要让各项能力同步增长,首先需要将它们整合到一条统一的建模主线当中。
而PixVerse R2的关键突破之一,就是将视觉、动作、音频、时序以及各类控制信号,整合进了一套可持续扩展的因果建模框架当中。这里的Scaling不仅指模型参数量的扩大,还包括世界复杂度、交互控制力以及系统稳定性的提升。
当这些原本异构的信号被纳入统一的表示体系后,复杂动态的虚拟世界就有了一套类似语言词元的统一计算坐标系。这也触及了Scaling的底层问题:新增的数据、任务和交互经验,能否持续融入同一套能力体系并形成复利。
具体来说,R2将Scaling拆分为了五个协同增长的维度:模型规模决定基础容量,数据拓展虚拟世界的分布范围,任务强化跨场景迁移能力,控制信号提升交互精度,时间尺度则决定模型能够建模的动态过程时长和复杂度。任意一个维度增加资源,都能反向增益其他维度,让模型整体能力得到提升,而不必单纯依赖扩大参数量。
这也意味着,R2的能力扩展已经从单纯的参数规模升级,转向了对世界状态空间本身的拓展。传统的Scaling模式在后期往往会面临边际收益递减的问题,新增的算力和数据很难带来同比例的能力增长,而R2重构了世界模型的投入产出逻辑,让每一份新增资源都能拥有更多的能力出口,最终更充分地转化为模型的整体能力。对于普通用户来说,这意味着生成质量更高、长程状态一致性更稳定、跨场景泛化能力更强,多模态控制也更加精细。
空谈不如实证,我们可以通过实际体验来看看PixVerse R2的表现。和上一代R1相比,R2支持的玩法更加丰富,不仅可以在赛博世界中探索,还能体验互动影游和实时数字人场景。
比如我们可以进入一个奥德赛草原风格的虚拟世界,通过WASD按键自由调整视角和移动方向,同时通过Prompt指令控制角色动作和剧情走向,真正实现玩家、导演、编剧多重身份合一,多少有点三权合一那味儿了。实际体验下来,整个过程几乎没有卡顿和延迟,临场感十足,实时生成的流畅度非常出色。
我们还可以尝试互动影游场景,比如在魔法学院中体验魔法大乱斗。画面质感堪比院线大片,更让人惊喜的是,这个虚拟世界可以根据用户的指令实时改写。比如在Prompt框中输入想要使出的攻击魔法,画面就会顺着指令继续推进,真正实现了实时性、画面质量、交互能力和记忆能力的同步在线。这也让创作者可以将更多精力投入到虚拟世界的核心设计中,而不必纠结于单帧画面或固定剧情。
那么,PixVerse R2究竟是如何做到兼顾实时性和通用能力的?核心答案在于其对底层技术路径的重新拆分。
过去行业在设计实时生成的底层技术时,大多是在固定的计算预算内做减法。一旦帧率和延迟被锁定,单帧的算力预算也就基本见顶,行业往往只能通过缩小模型规模、减少采样量、压缩计算量的方式,将大型模型塞进毫秒级的计算窗口,这也会导致生成质量、复杂运动效果和长程一致性受到影响。
但R2的核心设计思路是让能力提升和实时优化分头进行。先将基础模型的能力上限拉高,再单独解决实时化问题,这样实时世界模型的能力天花板就不会过早被单帧计算预算限制,而是更多取决于底层模型本身能够学习到的世界规律。
这也是R2技术体系中Omni Causal AR和Real-Time Acceleration两层架构的分工:前者负责提升模型的能力上限,后者负责保障实时性。
对于想要持续Scaling的实时世界模型来说,另一个常见难题是随着模态、控制信号和时间尺度的增加,建模逻辑容易变得碎片化。因此Omni Causal AR首先将短视频、长视频、多模态参考、音频和动作控制等内容,统一纳入一套因果自回归框架当中。通过动态Chunk适配不同的时间尺度,再结合Hybrid Teacher/Diffusion Forcing、多时间尺度记忆和Error Bank技术,解决长程生成中的误差累积、角色漂移和状态断裂问题。这样一来,新增的数据、任务、控制信号和模型规模,都可以持续转化为更强的世界建模能力。
当基础模型的能力得到夯实后,Real-Time Acceleration就会接手第二阶段的工作:将这套通用能力直接蒸馏到实时加速层中。经过持续预训练,Omni Causal AR先将生成质量、长程状态和因果能力打磨扎实,再作为教师模型和学生模型的共同能力底座,让后续的蒸馏过程尽可能沿用同一套世界理解逻辑,将模型能力完整地压缩进实时计算预算当中。简单来说,就是先打造虚拟世界的“大脑”,再为这个大脑配备实时加速器,最终实现实时世界模型的落地。
事实上,爱诗科技能够率先在行业中跑出实时世界模型的落地方案,并非偶然。该企业长期服务亿级用户,需要面对高度分散的需求、持续变化的场景和无穷无尽的长尾需求,模型每天都会被用户以各种意想不到的方式“测试”。而世界模型最终需要解决的,恰恰也是这类问题:如何在持续变化、充满噪声、随时会被外部输入打断的环境中,维持状态、理解变化并推演下一刻的内容。因此,R2采用的先提升能力、再解决实时效率的技术路线,其实是长期产品实践和技术积累自然形成的架构选择。
更值得关注的是,这套架构一旦成熟,其外溢价值将远远超出视频生成领域。在未来,内容生产、具身智能、虚拟人、游戏实时渲染等多个领域,都将逐渐汇聚到同一种底层能力上:持续理解环境、维持状态,并根据外部输入实时生成下一刻的内容。
在互动式娱乐市场中,这种变化会更加明显。剧情、场景和角色不再是预先编写好的固定内容,而是会逐渐演变为可以随着用户行为持续展开、持续变化的动态系统。届时,创作者需要亲自定义的将不再是单帧画面或某一段固定资产,而是虚拟世界的运转规则、角色的行动逻辑以及底层的世界观。互动娱乐将真正进入“内容不再被完成”的时代,用户不再只是观看故事、操控角色、通关游戏,而是真正生活在一个会回应自己、记住自己、并因自身存在而改变的数字世界当中。

