文章摘要
Current Robotics团队推出交互式世界仿真器CurrentWorld - 0,这是继Curr - 0后的又一突破。该工具整合跨本体适配、多视角同步与力触觉预测,可实时推演生成含物理反馈的画面。它能解决世界模型评测失真等问题,还可随时中止与保存状态用于策略微调训练,旨在成为机器人进入真实世界前的演练关卡。

一段看似普通的机械操作视频正在重新定义机器人研发的测试逻辑:机械臂精准拧开啤酒瓶盖,白色酒液裹挟着细密泡沫顺着瓶口涌出,随后倾斜酒瓶将酒液稳稳注入杯中。整套动作流畅自然,和真机实拍几乎没有区别,但很少有人知道——从瓶盖弹开的瞬间、流体的动态变化到全程的物理反馈,整段画面全部由AI实时推演生成。

这项成果来自Current Robotics团队,他们刚刚推出了一款名为CurrentWorld-0的交互式世界仿真器。这款工具首次将跨本体适配、多视角同步与力触觉预测整合进同一系统,是团队继人形全身精细操作模型Curr-0之后的又一突破性进展。

这支低调的技术团队背后,有着深厚的学术与产业积淀。团队创始人曾任职头部家电集团具身智能部门负责人,累计发表四十余篇顶级学术会议论文,总引用量超过5200次。作为国内最早开展VLA与世界模型研究的学者之一,他带领团队率先提出了扩散模型与VLM端到端的VLA范式TinyVLA,拓展了VLA+CoT策略的应用边界,相关成果发表于ICML与CoRL;同时他还较早提出了用世界模型进行具身策略评估的dWorldEval框架,该研究还入选了ICML高亮论文。值得一提的是,知名具身智能研究团队Physical Intelligence在其里程碑论文π0中,曾引用该团队的TinyVLA与ScaleDP研究成果。

从早期的VLA大模型研发、人类示教数据探索,到全身机器人学习的前沿实践,这些多年的技术沉淀最终成为了Current Robotics的核心技术底座。而CurrentWorld-0的核心目标非常明确:

机器人的身体和观察方式可以千差万别,但在走进真实世界前,它们演练的必须是同一个世界。

机器人世界模型的研发往往从通用视频生成模型起步,经过大规模预训练后,模型已经掌握了不少基础的视觉与运动规律:比如物体被遮挡后不会凭空消失、形状不会突然改变、运动轨迹通常保持连续性。对于常规的抓取动作,模型已经在海量训练数据中见过无数次“伸手-抓取-举起”的流程,这对于视频生成来说是优势,但放到机器人训练中却会带来新的问题。

大量的成功案例让模型形成了固定的成功轨迹先验,当一个未完全训练成熟的策略出现动作偏差时,模型反而会自动修正后续结果,让失败的动作看起来依然成功。比如机械臂实际没有抓稳物体,但生成的画面里物体却跟着机械臂移动;真实执行已经失败,但模型给出的未来预测却依然完成了任务。这种“自动纠错”会直接导致机器人评测结果失真。

Current Robotics此前在dWorldEval研究中,就聚焦于解决世界模型的动作可控性问题:当机器人的动作发生变化时,虚拟世界的后续状态必须同步跟随变化。具体来说,如果机器人动作向左偏移,虚拟物体就不能继续沿原轨迹运动;如果动作执行失败,模型不能自动补全成功的结果。这也是CurrentWorld-0最基础的设计准则:机器人怎么做,世界就怎么变化;即使做错了,模型也不能替它把结果纠正回来。

我们可以举一个简单的例子:让机器人把桌上的杯子往前推一点。如果执行者是固定双臂机器人,动作可能仅涉及机械臂关节的运动;如果换成带升降底盘的移动双臂机器人,那么底盘移动与升降机构的动作也会被纳入整体流程;如果是人形机器人,整个动作则需要全身的协调控制。同样一句指令,对应到不同形态的机器人身上,实际输入模型的动作参数完全不同。

因此CurrentWorld-0并没有预设统一的动作格式,而是为不同机器人本体保留了专属的动作子空间。模型的核心任务就是基于这些差异化的动作输入,推演后续的环境变化:比如杯子受到的作用力、位置偏移的距离,以及场景的后续状态变化。这也是跨本体建模的核心难点所在:无论机器人的形态、动作接口如何变化,同一物体的物理属性都不会改变,不会因为执行者不同就改变重量或运动规律。

仅仅掌握物体的位置变化还不足以完成完整的机器人评测。机器人在执行任务时通常会搭载多个摄像头:全局视角可以观察整个桌面场景,头部相机随机器人移动同步视角,腕部相机则紧贴机械手捕捉细节。一个动作发生后,同一个物体需要同时出现在多个不同视角的画面中。这时候,评测的核心就不再是单帧画面的逼真度,而是多个视角之间的一致性。

比如全局视角已经显示杯子向前移动了十几厘米,但腕部相机里的杯子却还停留在原位;或者物体被机械臂遮挡几秒后再次出现时,位置发生了突兀的跳变。任何一个视角出现这种视觉漂移,都会导致整个物理评测过程断裂。CurrentWorld-0需要维持的,正是多个摄像头对同一事件的同步一致记录。在当前的演示demo中,模型可以同步生成多路视角画面,让机器人、物体与场景的状态随着操作持续动态变化。

如果把任务从推杯子换成夹薯片或者削黄瓜,复杂度会进一步提升。当机械臂的夹爪已经移动到薯片盘上方,从视觉上看位置完全正确,但仅凭画面无法判断夹爪是否真正捏住了薯片。类似的,当削皮刀贴紧黄瓜表面时,也不能确定这一刀已经真正切入黄瓜:如果受力过轻,可能只是在表面划过;如果接触不稳定,下一秒就可能发生滑移。因此CurrentWorld-0还将力觉与触觉预测纳入了系统。

工具何时真正受力、接触是否实际发生、抓取是否稳定,这些原本无法通过像素直接观察到的状态,都会随着机器人的动作同步推演变化。

综合来看,一次完整的机器人任务评测需要锚定一整个连续的交互过程:

  • 机器人按照自身的动作逻辑执行操作,带动环境物体产生变化
  • 多个摄像头从不同视角同步记录这个过程
  • 当发生实际接触时,力觉与触觉反馈会补充画面中无法直接观察到的细节

CurrentWorld-0将跨本体适配、多视角同步与力触觉预测三者整合,最终目标是完整还原从动作输入、环境响应、接触发生到物理反馈出现的全流程。

在真实的真机测试中,想要复现某一个中间状态往往非常困难。随着动作推进,物体位置、机器人姿态与接触关系都会不断变化,如果想要从同一个节点重新尝试,通常需要重新复位整个场景,再从头执行一遍流程,既耗时又费力。但在CurrentWorld-0中,这个过程可以被随时中止。

当机器人在自主执行策略时进入潜在失败状态,操作员可以通过遥操作直接接管,从当前节点继续完成后续动作;当前的场景状态也可以被保存和回滚,一次尝试结束后,可以回到同一个节点,更换不同的动作策略再次推进。这样一来,同一个中间状态之后可以衔接不同的动作选择,得到不同的推演结果。

这一设计延续了该团队此前Hi-WM(Human-in-the-World-Model)的研究思路。在CurrentWorld-0中,每一次人工接管都会重新展开后续的交互过程:画面会持续动态变化,新的接触会触发对应的力与触觉反馈,操作员的纠正动作也会被完整记录下来。这些信息会组成新的交互轨迹,可用于后续的策略微调训练。原本只会被执行一次的状态,现在可以被反复调用,从不同的动作选择中探索最优路径。

随着机器人技术的发展,机器人的硬件形态会越来越多样,本体设计、数据采集、模型架构与控制方式都在不断分化。但无论选择哪一条技术路线,机器人的最终能力都需要回到真实世界中接受检验。正如《周易·系辞》中所说“天下同归而殊涂,一致而百虑”,尽管研发路径千差万别,最终的目标都是让机器人拥有适配真实世界的能力。

CurrentWorld-0想要扮演的,就是机器人进入真实世界前的最后一道关卡:让那些尚未经过现实检验的动作策略,先在这里完成演练、试错与优化。尽管机器人可以有上千种不同的执行路径,但它们最终面对的,始终是同一个标准化的虚拟世界。

以上内容不代表本平台立场,仅供读者参考