PixVerse R2:实时交互世界模型的技术突破与行业定位

据行业调研数据,2026年上半年,全球实时世界模型赛道的融资总额已突破30亿美元。国内创投统计显示,仅前7个月国内新增23家世界模型相关企业,数量超过2025年全年,累计融资规模超40亿元人民币。在行业快速发展的节点上,相关团队推出了实时视频世界模型产品R2。
其初代版本R1发布后,团队曾在24小时内完成实测,这是该团队在该品类推出的首款可交互模型版本,最令人印象深刻的特性是,用户可以在画面持续生成的过程中实时输入指令改变画面内容。R2延续了这套实时交互的基础架构,核心升级在于用户输入的影响不再局限于当前单帧画面,而是会持续作用于正在运行的虚拟世界内容。接下来我们将从多个维度,对R2以及该团队布局世界模型的思路进行详细解读与思考。
回顾R1的产品线迭代节奏,可以更清晰地理解R2的产品定位。2026年1月,R1正式发布,首次提出了“实时视频世界模型”的核心范式。
视频生成是一个持续运行的世界演化过程,模型在运行中持续接收用户输入、实时更新世界状态,连续输出与交互一致的音视频内容。用户看到的画面可以被实时影响,并与用户共同演化。
从1月到7月,R1陆续加入了个性化Avatar、共享世界和多人协同输入功能,团队同时发布了相关游戏引擎,将实时世界模型、AI智能体与结构化游戏机制结合,拓展了更多玩法可能性。我们此前也曾实测过基于R1的相关游戏产品,当时的判断是,尽管画面效果仍处于早期阶段,但游戏要素的完整性已经具备基础框架,官方也将其定位为早期研究阶段的系统。
R2正是在这条迭代路线上的延续。相较于R1,R2的核心升级聚焦在四个维度:一是画面的调整能否被后续内容记忆留存;二是故事线在用户干预后能否持续推进;三是角色能否保持身份与关系一致性;四是任务能否形成明确的落地结果。
官方此次展示了三类Demo,分别对应R2的三大产品方向:
在第一类游戏Demo中,信使携带货物躲避追兵,用户可通过WASD按键与空格键实时控制角色移动与跳跃。在被追捕的过程中,用户还可以在下方输入“用障碍物阻拦士兵”等指令,画面会即时生成对应障碍改变局势,将生成内容直接转化为实时玩法机制。更直观的场景是,当控制信使躲在角落时,输入对应指令即可让角色伪装成巡逻兵。
第二类是互动影视内容:古风场景中,用户输入“召唤老虎坐骑”等提示词,主角可以直接与生成的内容交互,比如骑上老虎。进入下一关卡时,画面会弹出武器选择选项,呈现出类似互动影游的完整玩法。
第三类是实时虚拟人交互:用户在下方输入文本对话,画面中的虚拟主体会实时响应。比如询问“你真的是三星堆外星人吗”,青铜器形象会即时活化为虚拟数字人,用四川话进行交流。更关键的是,该模型具备上下文记忆能力,后续追问“眼睛为什么这么大”时,数字人的回答可以承接前文,保持完整的对话连贯性。
此次公开的技术报告核心关键词是Scaling,也就是如何让模型实现持续的能力迭代。团队的整体思路非常清晰:R1验证了实时视频世界模型的技术可行性,R2则在此基础上加入更多数据、算力与输入类型,验证模型能否随着资源投入实现稳定的能力提升。
整个技术架构大致分为两层:第一层是Omni Causal AR,负责做大模型的整体能力边界;第二层是Real-Time Acceleration,负责将做大的模型能力压缩到实时交互的延迟要求内,尽可能减少性能损耗。
行业内常见的实时模型训练路径通常需要多个阶段:先训练一个质量高但延迟高的大模型,再通过多轮压缩得到反应快速的小模型。但这种路径存在明显缺陷:传统方案从双向视频基模继承而来,在世界模型的底座尚未夯实的情况下就进入多阶段调参,将生成步数压缩到实时模型的标准。每经过一个压缩阶段,前期训练的画质与动作表现都会出现不同程度的丢失,压缩阶段越多,损失越严重,训练成本也越高。更关键的是,实时阶段的微调仅能修补当前版本的表现,无法从根本上提升模型底座的能力,因此无法实现可持续的迭代进化。
因此R2将训练流程收敛为两个阶段:第一阶段采用与训练双向视频大模型同等的Scaling规模,夯实世界模型的底座能力;第二阶段在能力足够强大的基础模型上进行实时加速,而团队在前期的产品迭代中已经积累了丰富的相关经验。
首先是如何让长期运行的虚拟世界不会出现逻辑崩坏。这一层的模型可以接收文字、图片/视频、游戏手柄、键鼠操作以及声音等多种输入,输出同步的音视频流,用户随时输入都可以实时改变后续的内容走向。仅生成单段画面并不困难,真正的挑战在于,当画面连续生成时,需要始终保持在同一个虚拟世界的逻辑框架内。具体来说,在游玩过程中,每一次生成的画面都需要保持角色与场景的一致性,同时模型需要具备长期记忆能力,用户10分钟前的操作不会被遗忘。针对这一难题,R2采取了三项关键措施:
【1】按输入的性质切分时间
不同输入类型需要的模型反应速度差异极大,比如WASD操作和剧情文本输入的响应需求完全不同。传统方案采用固定节奏处理所有输入,导致快速操作需要等待慢速指令处理。R2则根据输入类型调整时间切片长度,操作类输入的切片更短,保证模型快速响应;剧情类输入的切片更长,确保内容可以完整呈现。
【2】故意用「有偏差的历史」训练
模型在训练阶段接触的历史画面都是标准干净的,但在实际运行中,生成新画面时需要回溯历史画面,如果回溯到存在瑕疵的历史帧且没有针对性训练,后续生成内容可能会出现连锁错误。R2在训练阶段同时使用干净画面和带瑕疵的画面作为训练素材:干净画面帮助模型保持质量上限,带瑕疵的画面让模型提前适应实际运行环境,即使前期画面出现小问题,后续生成也可以稳定继续。这项改进效果显著,衡量长期画面跑偏的核心指标从0.201下降到0.129,降幅约35.8%。
【3】把记忆分成三层
如果存储全部历史画面,算力和显存成本会极高,但如果记忆点过少,模型生成时的角色和世界设定一致性容易丢失。R2将记忆分为三层:第一层存储最核心的不可丢失信息,比如角色外貌、场景设定、世界规则;第二层关注近期生成的动作和镜头变化;第三层存储重要物体的状态。这种分层记忆实现了长期记忆与滚动更新的平衡,也是R2能够保持角色身份一致性的核心原因。
除了架构层面的设计,实时加速层还有多项工程化优化。大尺寸模型虽然能力强,但响应速度较慢,而实时视频世界模型对交互延迟要求极高,因此加速是行业内的常见需求。传统加速路径是让小模型跟随大模型学习,由大模型指导小模型的生成逻辑。但R2的关键设计在于,教师模型和学生模型使用相同的底层基础,都来自第一层夯实的大模型,这样小模型从一开始就掌握了整个虚拟世界的运行逻辑。加速过程的核心目标变为如何用更少的计算步数,得到尽可能接近大模型的生成效果。具体的加速手段有三项:
【1】把指令遵循能力和画面真实感这些训练目标分开处理,再进行合并,避免互相拖后腿。
【2】让模型少看没用的信息。
模型生成新画面时需要回溯历史画面,但大部分历史信息与当前片段关联度较低,R2仅让模型查询最相关的部分内容,节省了90%以上的查询操作,且团队表示生成效果基本没有损失。
【3】生成画面时,先用低分辨率把场景布局和运动定下来,再用很少的计算步数补充高分辨率细节,省掉大量重复计算。
整体来看,R2采用了先做强再做快的技术路线,通过记忆分层、错误训练等多项工程化优化,尽可能保证实时生成过程中虚拟世界的稳定性。不过官方也在技术报告的局限性部分提到,在实时延迟要求下,R2单次生成的质量与顶级离线视频模型仍存在差距,尤其是在复杂场景细节、动作自然度和物理一致性方面。官方同时表示,这种差距来自当前的训练规模,框架本身的上限尚未触及,随着数据和算力的持续投入,通过Scaling路线,这种差距会逐步缩小,后续的模型版本值得期待。
围绕世界模型赛道,技术路线已经出现明显分化。有行业专家提出了一套功能分类法,将所有自称世界模型的系统按输出分为三类:渲染器、模拟器、规划器。从商业路线来看,赛道也形成了两条主线:一条是“世界模型即产品”,比如将工具直接卖给创作者;另一条是“世界模型作为训练基座,智能体作为最终产品”,专注于打造通用智能体而非售卖模型本身。但目前整个世界模型的定义尚未统一,多条技术路线之间兼容性较弱。
在这样的背景下,AI视频模型公司进入赛道具备天然优势,主要原因有三点:一是技术连续性,视频模型在训练过程中已经隐性学习了物理世界的运行规律;二是数据与交互资源,世界模型需要海量的视频数据和真实交互信号,而视频公司恰好具备这两类资源;三是商业验证路径,AI视频是除代码开发外,AI行业另一条已经获得真实商业验证的落地路径。因此在尚未完全收敛的世界模型赛道中,该团队的定位清晰:作为实时交互世界模型路线的主要推动者。
初代R1确立了实时视频世界模型的基本范式,R2则验证了Scaling路线的可行性。作为本身拥有用户和商业收入的头部AI视频模型团队,其产品迭代将是赛道内最值得持续关注的动向之一。
如需体验相关产品,可通过官方渠道预约测试资格。

