文章摘要
由清华参股企业星动纪元推出的14B参数量全开源世界动作模型VPP2,近期在全球近20所顶尖机构共建的权威具身智能评测平台RoboDojo,未使用额外数据与辅助工具“裸考”,以平均成功率32.26%登顶榜首并拿下三项单项第一,验证了基模原生泛化能力的行业价值,目前该模型已开源,已有物流落地布局。

近半年来,具身智能领域的各类榜单更新频繁,但真正具备行业参考价值的突破并不多见,而RoboDojo榜单的几次榜首更替则是其中的例外。

上月的RoboDojo榜单因一款通用大模型的跨界表现引发广泛关注:GPT-6-Astra首次参评具身智能分支榜单,直接拿下榜首,给不少具身基础模型带来了竞争压力。而就在近期,榜单首位被来自中国的自研模型VPP2取代。

据行业观察消息,这款模型是由清华参股的具身智能企业星动纪元推出的最新世界动作模型(WAM),全称为Video Prediction Policy 2。VPP2以平均成功率32.26%、平均得分39.26分的成绩登顶RoboDojo榜首,同时拿下泛化、精度、记忆三项单项第一,这是继GPT-6-Astra之后,中国具身智能团队在该榜单取得的最高分。

这款模型还有三个核心特点:其一,参数量仅为14B;其二,训练过程未引入任何额外数据集,也没有使用agent RSI辅助;其三,模型完全开源,任何团队都可以复现本次夺冠的测试结果。在RoboDojo榜单上,VPP2的出现堪称里程碑式的突破。

RoboDojo是具身智能领域极具权威性的评测平台,由香港大学多媒体实验室牵头,联合UC伯克利、清华大学等全球近20所顶尖学术机构共建,背后团队正是知名仿真基准RoboTwin的原班人马,因此也被业内称为“具身智能界的珠穆朗玛峰”。

该榜单的核心在于“统一”二字:过去具身智能公司的测试各自为政,评测标准、硬件环境、任务题库都不统一,横向对比几乎无法实现。而RoboDojo通过真机与仿真双轨并行的模式,统一了硬件规格、通信协议和任务题库,从根源上避免了针对性优化和过拟合问题。

仿真环节包含42个双臂任务,从五个维度考察机器人的综合能力:泛化能力、记忆能力、操作精度、长程任务规划能力以及开放词汇指令遵循能力,每一项都对应真实工业场景中的核心挑战。

以泛化能力测试为例,机器人需要根据颜色和字母标识将积木分拣到对应盒子,或是按顺序组装汉堡部件,物体摆放位置全程随机,和实际工作场景中物体随机放置的状态一致,任何细微的位置偏移都可能导致任务失败。记忆维度则要求机器人按正确顺序依次拉动多个抽屉拉杆,全程零容错,错一步则整体得零分。精度维度考察插花、倒水这类精细操作任务,长程任务最具代表性的是“微波炉取三明治”,需要完成开关微波炉门、打开内部炉门、取出并放置三明治等近十个步骤,考验多环节任务的全局规划能力。开放词汇维度则要求机器人听懂任意口头指令,比如将桌面上出现的任意物品分拣到对应容器中。

该榜单的评分规则同样严苛:只要任务没有完整完成,即便大部分步骤正确,最终得分也为零。从头部模型的集体低分就能看出这套评测的区分度:在VPP2登顶之前,榜单头部模型的成功率普遍在个位数到两成出头,PI的π0.5模型成功率仅为8.31%,平均得分14.67;即便是此前登顶的GPT-6-Astra,成功率也不过22.48%,平均得分28.97。第一名的成功率仅两成多,足以说明这套评测的难度,也反映出整个行业距离大规模落地仍有不小的差距。

值得一提的是,GPT-6-Astra的成绩并非第三方复现结果,而是RoboDojo官方亲测的成绩,这也进一步提升了该榜单的含金量。

从测评结果来看,VPP2的实力支撑了其榜首的位置。在仿真评测领域,不少团队会通过引入额外数据集、使用agent RSI向智能体注入特权状态信息来提升分数,虽然不算违规,但会影响分数的横向可比性。而VPP2的训练全程仅使用官方标准数据集,未引入任何额外数据,也没有使用agent RSI辅助,相当于一场“裸考”。

这种“裸考”的成绩之所以更具价值,在于它证明了模型的优秀表现并非来自刷分技巧,而是预训练阶段沉淀的原生泛化能力。而原生泛化能力正是当前具身智能行业最稀缺的能力:当下行业讨论落地时,常说“没有落地”其实并不准确,头部公司大多已有落地项目,但真正的卡点在于大规模落地——每进入一个新场景,都需要花费大量工程性优化和后训练,适配成本高到难以规模化。只有将基模的泛化能力做上去,让模型见过足够多的世界场景、理解足够深的物理规则,进入新场景的边际成本才能大幅降低。

VPP2的成绩恰恰证明了泛化能力可以来自基模本身,而非场景定制的工程技巧,这对整个行业的意义远超过一个榜首的位置。

另一个值得关注的细节是,VPP2是一款仅14B参数量的模型。其对标对象英伟达Cosmos3参数量达到64B,是VPP2的四倍多,但在开放式任务的视频预测指令遵循率上,VPP2-14B在人类操作视角拿到0.80、机器人视角拿到0.90,而Cosmos3-64B仅为0.70和0.78,VPP2高出约11个百分点。

需要说明的是,VPP2的基座模型Wan2.1-14B在这项测试中的表现仅为0.32和0.04,性能提升完全来自训练方法而非基座本身。在真机侧同样如此:在ALOHA双臂零样本操作任务上,VPP2的成功率超出最强基线18.5个百分点。

小参数量模型的价值不止于“以小博大”的叙事。机器人的端侧算力存在硬约束,基模参数量每降低一个量级,推理成本、响应延迟和功耗都会大幅降低,换来的是更灵活的部署自由度。对于需要在物流中心批量交付机器人的企业而言,这绝非单纯的学术问题,而是关乎商业落地的核心命题。

拆解VPP2的技术论文,可以发现其核心优势更多来自数据管线和训练范式的精细化打磨,而非炫酷的新概念或新架构。当前具身模型赛道几乎每周都有新架构发布,新名词层出不穷,但星动纪元的实践给出了另一种思路:在架构趋同的当下,将基础工作拆细、做扎实,带来的性能提升远比更换架构更为直接。

VPP2的训练范式核心在于“解耦”。传统做法将视频预测和动作生成放在一起联合训练,而VPP2团队认为这种顺序本末倒置:视频预测的质量决定了动作生成的上限,因此两者必须拆开、按序训练。具体来说,模型先在虚拟环境中预演物理世界的变化,再基于预演结果输出动作。

整条训练管线分为四个步骤:事件级视频预训练、语言条件化视频预测、基于视频模型KV cache训练动作专家、针对评测任务的专项后训练。在策略执行阶段,模型每步仅需0.2秒的推理时间,就能输出0.8秒的动作块,兼顾了效率和精度。

论文中还有一个细节颇具启发性:当指令仅为“把碗放进盒子”时,对应的未来执行视频存在无数种可能性,映射关系极不稳定,模型很难学习;但如果将指令扩充为详细描述,比如“左侧机械爪拿起左侧的白色碗,放入透明盒内,相机保持静止”,未来的执行轨迹就会变成唯一且稳定的映射,数据分布高度集中。这种Caption工程上的洞察,直接决定了预测任务的可学性。

数据管线的打磨同样至关重要。VPP2的训练数据横跨多个来源:单臂操作数据、双臂操作数据、移动与人形机器人数据、人类第一视角数据以及通用视频数据,并且针对每一类数据都制定了专属的过滤策略:比如直接删除末端执行器不可见的片段,对完全可见的片段取首帧做标注。这种看似不炫酷的“数据洁癖”,却带来了实打实的性能提升。

这一细节也让人联想到行业内的相关判断:大模型领域最稀缺的不是天才,而是靠谱、对自己做的事情负责的人。所谓靠谱,就是将事情拆细并做到位。VPP2团队正是通过将基础工作精细化打磨,实现了性能的大幅跃升。

论文中还有一组容易被榜单新闻掩盖的实验:为VPP2搭配由GPT类模型担任的子任务规划器,负责高层决策规划后,五个任务的平均成功率从27.6%直接提升至57.6%,翻了一倍还多;即便是需要策略思考的井字棋任务,得分也从0分涨到了38分。

这组数据清晰展现了明确的分工模式:GPT负责“思考”,WAM负责“执行”。物理智能等于通用认知能力乘以通用物理执行能力,两者结合形成了“认知-规划-预测-执行-反馈”的完整闭环。

值得玩味的是,GPT-6-Astra亲自下场参评具身榜单,本身就是通用大模型公司想要切入“物理执行”层的信号。而星动纪元给出的则是另一条路线:将认知与物理执行解耦为两个独立的基础模型,各自规模化后再形成闭环协同。从2024年的相关模型到今天的VPP2,星动纪元是该范式的率先提出者,并且一步步将该范式从论文理论落地到榜单测试和实际产线中。

具身模型的范式仍在演进,但下一个范式的轮廓已经隐约可见。

近期具身智能领域新旧企业交替频繁,我们可以借VPP2登顶的机会,聊聊星动纪元这家企业的发展思路。

翻看星动纪元的打榜历史,可以发现这家企业在赛事参与上相当克制:部分赛事冠军是主办方主动基于公开成果测试得到的,属于被动参赛;真正主动下场参与的核心赛事均拿下了第一名。其选择赛事的逻辑也很清晰:都是头部对手亲自出席的正式赛场。

在榜单之外,星动纪元的落地进展同样明确:一方面,VPP2已经同步开源;另一方面,企业已经完成了物流行业首个相关验证,与多家物流企业达成合作,在全国多个省市的多个物流中心实现了机器人的常态化运营。

从某种意义上来说,星动纪元的打榜态度给行业内的其他企业提供了参考:打榜并非最终目的,而是衡量泛化能力的标尺。具身智能的最终落地场景,应该是那些不需要“重新调一遍”的新场景。在“视频可用”和“产品可用”之间的鸿沟,靠刷榜无法填补,但靠泛化能力可以做到。这或许是VPP2登顶之外,更值得行业记住的价值。

文末附上VPP2的相关信息供进一步了解:

开源代码:https://github.com/roboterax/video-prediction-policy-2

项目主页:https://robert-gyj.github.io/video-prediction-policy-2

以上内容不代表本平台立场,仅供读者参考