清华AIR Zeva:零权重更新让具身智能越用越强

模型不更新权重,能力却能持续增长。
这一反直觉的突破,来自清华AIR与域变换联合推出的全新具身智能方案Zeva。
在多个典型具身基准任务中,该方案将冻结模型的累计成功率从26%提升至73%;在真实化学实验室场景中,机械臂经过多次尝试后操作稳定性显著提升。更令人惊喜的是,仅需一次人类演示,模型就能快速掌握全新操作技能。
Zeva是首个实现In-Context Causal Learning(ICCL)的具身WAM,它允许模型在不更新权重的前提下,从自身交互经验中持续学习。当这种能力成熟落地,具身智能将迎来属于自己的“GPT时刻”。
具身智能真正的核心瓶颈,在于模型部署到真实场景后能否持续优化自身能力。传统的解决方案通常需要重新采集数据、微调模型或是进行测试阶段训练,但这类方法依赖梯度更新,不仅速度慢、成本高,还可能在适配新任务时破坏模型已掌握的能力。
另一类上下文学习方法虽然可以让模型根据演示或任务描述调整行为,但这类方案仅解决“任务理解”层面的问题,无法让模型从动作产生的实际后果中学习物理因果关系。
过往的跨域迁移方案,大多聚焦于仿真到真实场景、跨本体迁移或是跨任务泛化,本质上是在不同域之间搬运已有的“任务经验”,依赖数据对齐或表征对齐来实现迁移。
而Zeva迈出了关键一步:它迁移的不再是任务经验,而是“动作与状态变化之间的因果关系”。
同一个模型,既可以把仿真环境中学到的物理因果知识迁移到真实机械臂场景,也可以利用某次尝试中积累的失败经验指导后续相似物理过程的操作,甚至可以直接将人类的一次演示转化为自身的因果上下文。
这种跨域迁移完全通过上下文完成:模型在上下文中推断当前环境的因果结构,并将这些因果知识用于生成后续动作,这就是Zeva定义的In-Context Causal Learning。
举三个典型的应用场景:一是从放置称量纸的误操作中提取因果关系,通过上下文内学习提升后续任务精度;二是从称取试剂至称量纸的失误操作中总结规律,优化后续流程;三是通过一次人类演示完成上下文内的因果学习,快速掌握新操作。
Zeva的核心技术模块都属于模型推理链路的一部分,全程无需梯度更新,主要包含三个关键部分:Causal Transition Encoder、双时标因果记忆、上下文策略注入。
在每一个环境步骤中,Zeva都会提取三类核心信号:视觉状态、动作编码以及观察到的状态变化。这些信号会被递归编码为因果交互状态,进一步投影为阶段标记和因果交互信号。
这些因果信号会被组织为双时标上下文:短暂交互轨迹负责保障当前尝试内的操作连贯性,持久交互记忆则会跨尝试累积可复用的经验。在进行决策时,Zeva会检索与当前任务阶段匹配的交互证据,构造因果提示并注入冻结的Cosmos3动作生成模型,整个过程零梯度更新。
亮点一:Causal Transition Encoder,让模型显式感知“动作→结果”的关联。
该模块会让模型显式学习动作引发的状态变化,训练目标涵盖因果效果预测、任务聚类和阶段进度预测,确保因果交互信号真正携带了物理因果相关的信息。
亮点二:双时标因果记忆,实现跨尝试的自我进化。
短暂交互轨迹保障单次操作的流畅性,持久交互记忆则会将单次失败、修正和成功的经验沉淀为可检索的上下文,让同一个模型在多次重复尝试中能力持续增强。
亮点三:上下文策略注入,让冻结模型直接消费因果上下文。
通过因果提示将任务信息、阶段信息和交互证据注入生成模型,不会添加额外噪声,也不参与流程损失计算,仅作为条件影响后续动作生成,这也是“不调整权重也能实现进化”的核心设计。
和传统的测试阶段训练方案相比,Zeva的优势十分明显。
在RoboCasa365-Atomic5基准测试中,Zeva的平均成功率达到76.8%,表现优于其他同类方案。更值得关注的是部署后的自我进化曲线:累计成功率从第一次尝试的26%提升至第四次尝试的73%。
在真实化学实验室ChemLab-Evo场景中,三个原子任务的成功率同样呈现单调增长趋势:拾取试管任务从65%提升至100%,放置烧杯任务从25%提升至70%,倒水任务从30%提升至80%。
Zeva还支持单次人类演示增强功能:仅需一次人类演示初始化持久交互记忆,模型无需微调就能复现关键操作。量化数据显示,人类预热演示在放置烧杯任务上最高带来20个百分点的成功率提升,在倒水任务上带来15个百分点的提升。
Zeva的深层价值,在于将具身模型的缩放路径从“参数空间”延伸到了“上下文空间”。
传统的模型缩放思路,通常通过扩大数据规模、参数数量和算力来提升模型能力,而Zeva展示了另一种全新的缩放方向:在部署过程中不断增加可供模型使用的因果上下文。
每一次交互都会产生新的交互证据,这些证据会被压缩为因果交互信号并存入双时标记忆中。每多一次交互,模型就多一次对当前物理环境的“隐式系统辨识”。
其理论基础在于,模型可以将每个新场景的环境属性作为隐变量,在推理过程中从过往的动作-效果证据中推断出来。物体质量、关节约束、接触特性、摩擦条件等环境参数,都可以通过交互信号被隐式估计,让冻结的策略模型在不改变参数的前提下,不断逼近当前物理系统的真实动态。
更进一步,Zeva的因果交互信号是效应空间中的紧凑表示,直接编码了物理效应信息。跨任务效应检索实验显示,不同物体、视角和任务指令下的等价物理效应,会在该空间中彼此靠近。这意味着模型学到的不仅是具体任务的操作方法,更是“这类物理效应如何产生”的通用规律,这种表示天然支持跨域迁移,也让“域变换”成为可计算、可检索、可复用的技术概念。
如果将视觉语言模型看作“任务理解与动作生成”的基础设施,将世界模型看作“经验想象”的基础设施,那么Zeva定义的ICCL就是“现场因果学习”的基础设施。
它将模型部署从“能力消耗”转变为“能力积累”,把每一次失败从无用噪声转化为可检索的因果证据。
如果ICCL的范式成立,具身智能的缩放将多出一条独立于参数规模的新曲线:交互次数越多,因果上下文越丰富,模型对当前物理域的辨识就越准确,任务成功率也就越高。这正是“域变换”作为全新技术范式的真正含义。
清华AIR与域变换联合发布的Zeva,重新定义了具身模型的自进化逻辑:无需调整权重就能越用越强,无需重新训练就能通过一次人类演示掌握新操作。域变换开启的这条全新缩放路径,将让机器人在真实物理世界中自主学习因果规律、自主完成进化。

