文章摘要
当具身智能进入真实场景,传统 VLA 模型在长程任务中存在局限。近期,上海创智学院与智元机器人联合发布 τ0 - VLA,提出“慢思考 - 快执行”分层架构,结合世界模型引导测试时计算。其经大量真机数据训练,实验显示长程任务完成能力强,正形成完整具身智能路线。

当机器人走出实验室的封闭场景,进入家庭、工厂等真实世界,如何稳定完成复杂的长程任务,已经成为具身智能落地的核心命题。就在近期,一项新的技术方案为这个问题提供了全新的思路。

2026年的行业盛会中,具身智能成为最受关注的技术方向之一。与过去聚焦单点技能展示的机器人演示不同,产业界的关注点已经转向一个更现实的问题:当机器人脱离精心设计的演示环境,能否连贯完成一项包含数十个步骤的复杂任务?这标志着具身智能进入了全新的发展阶段——竞争核心已经从「让机器人学会一个动作」,转向「让机器人完成一项任务」。

不过,从「掌握单个动作」到「完成完整任务」,中间仍存在一道难以逾越的鸿沟。过去几年,随着视觉-语言-动作(VLA)模型的发展,机器人已经能够根据自然语言指令完成抓取、整理物品、使用工具等基础操作,具备了「理解世界并执行动作」的基础能力。但真实世界的任务极少是孤立的单步操作,比如整理房间、准备一餐饭、仓库拣选这类典型场景,往往需要数分钟甚至更长时间,包含数十个连续的决策步骤。机器人不仅需要感知当前环境,还要理解任务进展、判断下一步行动,甚至预测自己的行为对最终目标的影响——这种能力,正是当前机器人技术的最大瓶颈。

那么,是不是意味着传统VLA模型已经不再适配具身智能的新叙事?答案显然是否定的,VLA的能力边界仍在被不断拓展。今年4月,相关团队发布的π0.7通过引入多样化上下文条件,让VLA模型能够利用更多类型、更大规模的现实世界数据,在训练端进一步提升了复杂任务的泛化能力。这一进展让行业意识到,既然可以通过优化训练阶段的数据利用效率来提升模型能力,那么在推理阶段,是否还有更多可以挖掘的空间?

近期,上海创智学院罗剑岚团队与智元机器人具身研究中心联合发布的τ(0)-VLA,为这个问题给出了针对性的解决方案。该模型提出了面向长程任务的「慢思考-快执行」分层VLA架构,通过将高层任务规划与低层动作执行解耦,并首次将Test-Time Scaling推理与世界模型推演引入具身智能上层决策,让机器人能够完成超过数十个连续决策步的长程任务衔接,实现真实场景下的自主闭环执行。简单来说,π0.7是让VLA从更多数据中学习经验来处理复杂问题,而τ(0)-VLA的破局点则在于让VLA「深谋远虑」,在执行任务前投入算力进行长思考,真正做到想清楚再行动。

值得一提的是,τ(0)-VLA还是当下最大规模真机数据预训练的具身基础模型,预训练共使用40115小时真实物理世界交互数据,其中包括超2万小时真机数据,覆盖多种机器人形态和操作场景。实验结果显示,在多项长程真实任务中,τ0-VLA相比传统VLA模型展现出更强的任务完成能力,或许让机器人学会「先想后做」,正是解锁真实场景闭环执行的关键钥匙。

传统VLA的局限:从反应式决策到长程任务的适配难题

过去两年多,VLA无疑是具身智能领域最重要的技术路线之一。以π0.5、GR00T为代表的VLA模型推动机器人迈过了关键阶段:能够理解自然语言,并根据视觉环境完成相应动作,在抓取、移动、简单操作等短程任务中展现出前所未有的灵活性。但随着具身智能从实验室demo转向真实物理场景落地,传统VLA模型的局限逐渐暴露。

现实世界的任务往往不是「拿起桌上的杯子」这类几秒就能完成的操作,而是包含多个阶段、多个决策节点的长程任务。以整理房间为例,人类只需要一句简单指令,但机器人需要完成找到衣服、收集衣服、放入篮子、拿起包、挂起来、整理桌面等一系列步骤,还要在执行过程中不断根据环境变化调整策略。这意味着,只让机器人拥有精准的动作能力已经远远不够,更重要的是让机器人具备围绕长期目标持续规划、执行和纠错的能力。

当前主流的VLA路线本质是反应式(Reactive)决策范式:将当前观测与语言指令直接映射为低层动作,缺乏对任务历史、执行进度与执行后果的显式建模。这种「看一眼、做一下」的直觉映射,在数秒级别的短程任务中表现尚可,但如果用在耗时数分钟、涉及数十个连续步骤且仅具备局部环境观测的复杂场景中,就会暴露出三个系统性缺陷:

  • 误差累积:在数十步的长链条决策中,由于缺少中途核验与轨迹纠偏机制,机器人每一步微小的控制偏差,比如夹爪偏移1毫米或底盘角度偏差0.5度,都会在时序上被逐级放大,最终导致任务失败;
  • 步骤重复与遗漏:反应式范式仅依赖即时单帧或短序列观测,缺乏对「已完成/未完成」子任务状态的可靠记忆,导致重复执行同一无效动作,或关键步骤跳过——比如已经完成收杯子动作,之后又再次执行收杯子,或是未开柜门就尝试取物;
  • 目标漂移:在长上下文与复杂环境扰动下,反应式模型由于缺乏全局进度的实时对齐与反思机制,随着执行时间推移,模型的注意力会逐渐被局部的环境细节吸引,导致其行为逐渐偏离初始指令的全局意图,执行时间越长,机器人行为越容易偏离最初目标。

为此,行业迫切需要一种全新的解决方案。τ(0)-VLA给出的答案是:把「想清楚」与「做到位」彻底解耦,构建「慢思考」与「快执行」协同的双系统架构,并将世界模型引导的测试时计算引入具身决策,从而让机器人在行动之前具备理解任务、预测未来和选择路径的能力。

双系统架构+世界模型引导的测试时计算:让机器人「先想再做」

从认知科学来看,τ0-VLA的设计灵感源自人类脑科学的双系统理论:人类完成复杂任务时,并不会直接控制每一个动作,而是先理解目标、制定计划,再通过身体完成执行——上层负责长视野的前瞻规划与推理,也就是「慢思考」;下层负责高频稳定的运动肌肉反应,也就是「快执行」。

对应的,τ0-VLA将机器人系统拆分为高层规划系统和低层动作系统,让两个模块分别处理不同时间尺度的问题:

  • 高层系统(High-Level Policy),即「慢思考」系统:理解用户目标,将复杂任务拆解为多个子任务,并通过任务记忆持续跟踪执行状态,负责规划回答「下一步做什么」;
  • 低层系统(Low-Level Policy),即「快执行」系统:负责将高层系统选定的子任务转化成稳定、实时的全身动作。

这一分层设计,避免了传统VLA试图让单一模型同时承担长期规划和实时控制的困境,将「决策审议」与「动作执行」彻底解耦为两个独立系统。同时,将昂贵的测试时算力(Test-Time Computation)倾斜给高层慢思考系统,使其可以投入更多计算进行任务推理,专注于全局规划与风险防范;而为低层保留了高频、低延迟的动作控制接口,保持快速稳定的动作执行,由此实现「想清楚」与「做到位」的有机统一。

高层系统:四大模块协同构建「子任务级束搜索」机制

高层慢决策系统运行在子任务粒度上,由四大高度协同的子模块共同构建起完整的审议与反思闭环:

  • Propose Model(候选任务生成):结合指令、当前观测与执行历史,生成多个候选下一步子任务。例如,针对「制作奶茶」任务,当前杯子已经准备好,模型可能提出:方案A加入茶;方案B加入牛奶;方案C加入配料。
  • World Model(世界模型):基于图像编辑模型,为每一项候选预测执行后的环境状态,输出「想象中的未来画面」,回答「如果机器人执行这个任务,未来世界会变成什么样」?例如:执行「加入牛奶」动作后,世界模型预测未来的杯子状态、桌面状态、任务进度。需要注意的是,世界模型仅负责客观推演、不做价值判断。
  • Value Model(价值评估):对世界模型推演生成的未来状态进行多维度打分,精准评估该动作对总体任务目标的完成度、安全性以及隐性风险。
  • Reflective Model(反思):负责横向对比所有候选方案的推演结果,输出最终的子任务决策;若得分最高的方案与整体任务进度存在冲突,则触发重选与规划调整机制。

这四大模块协同构建了全新的子任务级束搜索(Beam Search)机制。这是τ0-VLA在具身智能推理领域的创新突破——它打破了传统LLM在文本空间中单纯重复采样择优的局限,首次将测试时算力精准投向对真实物理世界「链式物理影响(Chain-of-Physical-Impact)」的前瞻评估。

除了双系统架构,τ0-VLA另一个重要设计,是将世界模型引导的测试时计算引入具身决策过程中。过去一年,世界模型成为业界频频提起的热门话题,很多工作关注模型能否生成逼真的未来场景,但对于机器人而言,真正有价值的问题并不是「未来画面是否足够真实」,而是「如果执行某个动作,未来世界会发生什么变化」。τ0-VLA中的世界模型承担的正是这一角色:面对一个任务,机器人不会立即选择动作,而是先对不同方案进行未来状态预测。

而测试时计算(Test-Time Computation)是近年来大模型领域兴起的方法,传统模型能力提升主要依靠更多参数、更多训练数据集和更强算力,测试时计算则强调在模型实际推理阶段投入额外计算,让模型面对复杂问题时进行更多分析。τ0-VLA进一步将其引入机器人领域,让机器人具备了一种类似「思考预算」的能力:简单问题保持效率,复杂问题投入更多推理资源。配合深度思考动态路由机制,模型仅在判定为高难度的子任务节点启动深度思考,其余场景直接输出快速决策,在保证决策质量的同时兼顾推理效率。

低层动作系统:统一40维动作空间与高频闭环执行

低层快执行系统是一套专为真实物理部署设计的高频全身动作模型,其技术核心在于构建了统一40维全身动作空间。通过统一的动作表示方式,多种形态的机器人(单臂、双臂、固定底座、轮式移动人形等)无需改变模型主干,仅需通过掩码(Masking)屏蔽无需使用的自由度,即可实现跨本体的无缝适配。这种统一表达不仅极大地降低了具身策略对特定硬件的依赖,更为模型从异构机器人数据中学习通用的物理交互规律奠定了基础。

执行过程中,低层动作系统通过视觉反馈持续更新环境状态,并以闭环方式生成连续动作。相比一次性输出固定动作序列,闭环执行能够让机器人根据实时环境变化及时调整行为,提高面对真实世界扰动时的稳定性。最终,通过高层任务规划与低层动作执行的紧密协同,τ0-VLA实现了从「理解任务」到「完成动作」的全链路闭环:高层系统规划下一步目标,低层系统将目标转化为可靠执行,让机器人能够在复杂环境中持续推进长程任务。

训练:4万小时真实机器人数据,支撑物理世界学习

除了模型架构,数据正在成为具身智能竞争的关键因素。不同于LLM可以依靠互联网数据获得能力,机器人需要从真实物理世界中学习动作与环境之间的关系,包括物体如何变化、动作如何影响环境以及任务如何持续推进。因此,数据规模和数据质量,正在成为决定具身模型能力的重要因素。

为了训练τ0-VLA,研究团队构建了一套40115小时真实世界机器人交互数据的训练体系,数据由机器人真机数据、UMI数据和多个公开数据集共同组成,覆盖固定机械臂、移动机器人以及双臂机器人等多种形态。其中,包含当前具身智能领域规模领先的超过2万小时真机交互数据,涵盖AGIBOT G1、ARX AC One和Franka等多个机器人平台。这些数据共同构成了一个覆盖多机器人、多任务、多场景的物理世界经验库,让模型能够学习不同机器人形态下的通用操作规律。

在训练方式上,τ0-VLA采用了高层规划系统与低层动作系统协同训练的方式。低层策略主要从机器人示范数据和多模态数据中学习动作执行能力,负责将任务目标转化为具体的机器人控制信号;高层规划器则利用任务分解标注、执行记忆以及世界状态变化信息,学习如何拆解任务、预测未来并选择下一步行动。此外,团队还加入多模态联合训练数据,用于保持模型原有的视觉语言理解能力。最终,τ0-VLA形成了一套从感知、理解到规划、执行的完整训练体系:机器人示范数据解决「如何行动」的问题;多模态数据强化「如何理解世界」的能力;高层规划数据则帮助模型学习「如何完成长期目标」。这也是τ0-VLA区别于传统VLA的重要地方:它训练的不只是一个动作模型,而是一套面向真实世界任务的机器人智能系统。

为了验证长程任务能力,研究团队没有停留在传统的抓取测试,而是在真实机器人平台上评估更加复杂的任务场景,包括全屋清洁、烹饪、制作奶茶、抽屉搜索以及桌面整理等。这些任务的共同特点是,成功并不取决于某一个动作是否完成,而取决于整个任务链能否持续推进。比如,在「全屋清洁」任务中,机器人需要进入卧室收集脏衣服放入洗衣篮,找到手提包挂到衣帽架,找到毯子递给人员;完成卧室任务后,前往客厅整理桌面物品,最后将炉灶旁的番茄炒鸡蛋端到客厅桌子上。

实验结果显示,引入层级规划系统(Hierarchical System)后,τ0-VLA在AGIBOT G1平台上的平均成功率(SR)由27.5%提升至45.0%,平均任务进度(Progress)由80.10%提升至87.85%,相比π0.5、GR00T N1.7等主流VLA模型,τ0-VLA在长程任务完成能力上表现出明显提升。这表明,在多步骤、长时间任务中,仅依靠动作预测并不足够,高层任务规划与世界模型引导的推理机制能够显著增强机器人的执行能力。此外,团队还测试了τ0-VLA在不同机器人平台上的直接执行能力,在不调用高层规划系统的前提下,τ0-VLA在四项操作任务中均取得最高性能表现,其中三项任务达到10/10成功率。相比GR00T N1.7、LingBot-VLA和π0.5等模型,τ0-VLA展现出更强的跨机器人形态泛化能力和稳定操作能力。这表明,τ0-VLA不仅具备任务规划能力,其低层动作策略也具备跨机器人形态的泛化能力。

τ0-VLA背后,一条完整的具身智能路线正在形成

从模型本身看,τ0-VLA展示了一种从「动作智能」走向「任务智能」的系统架构。早期阶段,行业关注的是机器人「能不能动」,竞争重点集中在硬件结构、自由度、运动速度以及控制精度等方面;随着VLA的发展,竞争进一步转向机器人「能不能理解指令并完成动作」,模型开始赋予机器人更强的视觉理解和操作能力。但进入真实应用场景后,单点技能突破只是基础,机器人真正需要解决的是如何在开放环境中持续完成复杂任务。这意味着,具身智能正在从「会动」走向「会做事」。未来机器人不仅需要生成动作,还需要理解目标、规划路径、预测结果,并在执行过程中根据环境变化不断调整。

而τ0-VLA提出的「先推演、后执行」范式,探索了一种新的机器人智能系统路径:在保证低层实时控制的同时,通过任务记忆、世界模型和测试时计算增强高层决策能力,让机器人从被动执行走向主动规划。

如果把τ0-VLA放到团队近3个月的工作中来看,它的意义还不止于一个模型。此前,团队先后发布了面向真实世界大规模后训练强化学习系统LWD、预训练具身世界模型τ0-WM。如今,τ0-VLA进一步将高层规划、世界模型与低层执行组织到长程任务框架中。三项工作共同指向一条以「大规模预训练+大规模后训练」为核心的路线:预训练提供通用能力,世界模型负责预演行动后果,τ0-VLA完成复杂任务,真实部署产生的数据再通过LWD回流训练,形成持续进化的数据闭环,从而使机器人的能力在部署后持续进化,真正从实验室走向复杂的真实场景。

总的来说,这一路线试图突破静态模仿学习的局限,让机器人在进入真实世界后继续学习、修正和提升,更是在向业界证明:将大模型的泛化能力与真实物理世界的强化学习数据飞轮相结合,是让具身智能真正实现规模化部署的必由之路。

以上内容不代表本平台立场,仅供读者参考