文章摘要
StarVLA团队推出面向视觉语言动作模型的开源VLM底座VLAct,针对机器人轨迹数据成本高、难覆盖全场景的痛点,提出三项新预训练策略解决现有方法特征难迁移的问题,仅用开源数据与16张GPU就取得多榜单领先成绩,跨机器人迁移表现优异,仅20%下游数据就超过英伟达同类模型全量数据基线,相关内容已全部开源。

Beyond Data Scaling:让每条机器人数据“学得更值”

StarVLA团队近期推出了面向视觉语言动作模型的VLM底座VLAct,这款模型的持续预训练仅使用开源数据集与16张GPU,却取得了亮眼的成绩:在RoboTwin 2.0榜单中成功率达到92.5%,在RoboDojo榜单中超过所有明确标注为World Action Model(WAM)的模型;面对预训练阶段从未接触过的GR-1机器人,仅使用20%的RoboCasa-GR1下游数据,就超过了NVIDIA GR00T N1.6的全量数据基线。目前模型权重、Checkpoint、训练代码和Pipeline均已全部开源。

近年来,大模型领域的规模化发展路径已经被充分验证:随着数据量、模型参数和算力投入的提升,模型能力会持续进阶。视觉语言动作模型(VLA)自然也希望复刻这一规模化增长的路线,但机器人领域存在一个难以绕过的现实限制:机器人轨迹数据无法像网页数据一样从互联网直接爬取。每条可用的机器人轨迹都需要实体机器人在物理世界中完成对应操作,背后伴随着遥操作部署、数据采集和硬件运维的成本。更复杂的是,机器人最终需要面对的场景、物体、任务和机器人形态组合几乎是无限的,想要通过规模化数据覆盖所有可能性几乎不可能。

VLAct并非否定数据规模化的价值,而是希望解决另一个关键问题:在固定的数据预算下,如何让每条机器人轨迹数据在模型骨干网络中留下更多可以跨任务、跨动作头、甚至跨机器人形态迁移的知识?

团队的研究起点来自一个反直觉的实验现象:目前多数VLA模型都会基于预训练的VLM挂载动作头,再使用机器人数据进行持续预训练,按照常规思路,动作预测的准确率越高,代表本次预训练的效果越好。但实际测试结果却并非如此。以RoboTwin为例,使用OFT Head进行持续预训练后,当下游任务继续使用OFT Head时,成功率从61.7%提升至75.8%;但如果将同一个骨干网络更换为PI Head,下游任务成功率反而从60.5%下降到55.1%;更换为GR00T Head时,成功率更是从51.2%降至28.9%。这意味着,在单一动作头上表现更好的模型,并不代表其骨干网络具备更强的通用迁移能力。

这种现象的本质在于,动作头和骨干网络是联合训练的,当仅使用单一动作头进行训练时,骨干网络会逐渐学习到最适配该动作头读取的特征几何结构。这对于当前的任务而言确实高效,但当更换动作头、任务甚至机器人形态时,这类特征表示往往无法复用。论文将这种现象称为head-specific representation collapse。

基于这一发现,VLAct重新定义了持续预训练的目标:不再训练一个仅擅长特定动作预测的固定策略初始化模型,而是训练一个能够被不同动作头、不同任务、不同机器人形态复用的VLM骨干网络。为了实现这一目标,团队在持续预训练阶段采取了三项关键策略:

第一,保留VLM原有的视觉语言先验。VLAct会保护视觉编码器和较浅的LLM层,同时混入图像字幕数据,确保模型在学习动作相关知识的同时,不会丢失预训练阶段学到的通用视觉语言表示。

第二,避免单一动作头主导训练。VLAct同时挂载了OFT、PI和GR00T三种连续动作头,让它们共同读取同一个骨干网络并预测同一套动作。这迫使骨干网络学习能够适配多种解码器的特征表示,而不是仅适配某一种动作头的格式。值得一提的是,预训练结束后这些动作头可以直接丢弃,下游任务可以重新初始化专属的动作头。

第三,合理共享不同机器人间的物理语义。例如“打开/关闭夹爪”这类操作在不同机器人上的物理意义高度相似,但不同机械臂的自由度和运动学结构存在差异,因此VLAct仅统一真正一致的动作维度,其余部分则保留针对不同机器人形态的专属表示。

最终的实验结果验证了这一思路的有效性。在LIBERO-Plus基准测试中,VLAct达到了82.6%的成功率;在双臂操作任务RoboTwin 2.0中,在数据规模化设置下的Clean模式成功率达到92.5%,Random模式也达到90.8%。在RoboDojo榜单中,VLAct取得了10.66的Score和7.60%的Success Rate,超过了所有明确标注为WAM的参赛模型,证明这套预训练方案并非仅在单一机器人或单一基准测试上有效。

团队还在Franka真机上进行了测试,覆盖了单臂短时序、长时序、双臂协同,以及Novel Object和Full Substitution等分布外设置的任务。最能体现模型迁移能力的实验来自RoboCasa-GR1:GR-1机器人在VLAct的预训练数据中从未出现过,团队将预训练得到的骨干网络迁移到GR-1上进行下游微调。仅使用20%的RoboCasa-GR1轨迹数据,VLAct就达到了49.5%的成功率,超过了GR00T N1.6和Qwen3VL-OFT的全量数据基线;当使用100%的下游数据时,VLAct的成功率进一步提升至54.0%。

VLAct的研究并非想要证明“数据不重要”,机器人数据的规模化依旧是VLA领域发展的重要方向,但考虑到机器人数据的稀缺性、高昂成本以及难以覆盖全场景的局限性,骨干网络的表示质量也应该成为VLA规模化发展的独立轴线。过去行业更多关注“还能收集多少机器人数据”,而VLAct则希望同时提出另一个问题:“在相同的数据预算下,这些数据能够让模型学到多少可以迁移的知识?”

整个VLAct的持续预训练基于Qwen3-VL-4B模型,仅使用公开机器人数据和16张GPU完成。目前模型权重、Checkpoint、数据处理流程和训练Pipeline均已开放,团队希望将这款更适配物理世界、更便于研究使用的VLM骨干网络分享给VLA社区。

项目链接

以上内容不代表本平台立场,仅供读者参考