文章摘要
上海交通大学与齐鲁工业大学(山东省科学院)团队提出Enfold方案,解决世界生成模型用于机器人具身控制时实时控制负担重的问题。该方案将未来信息“折叠”进当下表示,部署时无需生成器进入控制回路。实验显示,Enfold在延迟、成功率等指标表现出色,还具备重规划等能力。它重新定义生成模型角色,其思路有望拓展到其他下游任务。

机器人在执行具身任务时,需要精准预判动作后的场景变化、接触关系演化以及长程任务的推进节点。世界生成模型能够合成可视化的未来场景,为机器人提供“想象未来”的能力,但如果每次动作决策都需要完整运行一次视频生成流程,这种“想象”本身就会成为实时控制的沉重负担。来自上海交通大学与齐鲁工业大学(山东省科学院)的研究团队提出的Enfold方案,正是为了解决这一痛点:它不再将世界生成模型仅仅视为需要反复调用的未来模拟器,而是将生成器构造未来时产生的多层内部计算,转化为一种可以直接从当前场景推断、同时服务于控制与生成任务的表示形式。通过这种方式,未来信息在训练阶段被“折叠”进当下的表示中,部署时就无需让生成器进入动作控制回路。

该研究的完整信息如下: 论文标题:Enfold: Folding World Model Imagination into Predictive Representations for Ultra-Efficient Embodied Control 论文链接:https://arxiv.org/html/2607.26657v2 项目主页:https://zwl666666.github.io/enfold/ 代码仓库:https://github.com/zwl666666/enfold 作者团队包括曾伟力、行义通(共同第一作者),刘福龙、杨成群等多位研究者,通讯作者为晏轶超。

指标 数值
LIBERO 平均成功率 97.8%
Enfold 动作块延迟 134 ms(Fast-WAM 的 3.7× 速度)
Enfold-Flash 动作块延迟 49 ms(Fast-WAM 的 10.1× 速度)
真机 ID / OOD 平均完成分数 89.7% / 76.6%

实时控制的核心瓶颈:生成式模拟的延迟代价

现有基于世界模型的具身控制方案大致可以分为五类,不同方案的接口设计决定了生成式计算是否会进入控制回路:

方案类型 未来信息接入方式 部署时是否运行生成路径 核心特点与限制
未来像素/视频监督 编码器或策略直接预测未来画面 不一定 目标直观,但像素包含大量与动作无关的纹理和随机细节
Imagine-then-Act 先生成视觉未来,再据此预测动作 未来显式可解释,但生成成本进入每次决策流程
生成缓存或隐藏状态 动作头读取生成分支的中间结果 避免完整视频解码,但仍依赖在线生成计算
Fast-WAM 类联合架构 联合学习视频与动作,可跳过显式未来生成 已证明无需输出视频也能行动,但视频与动作仍在耦合架构中共同塑造特征
Enfold 当前编码器预测真实未来诱发的多层生成器状态 将生成器作为训练时的教师,形成与动作学习解耦、又可反馈给生成器的表示接口

Enfold 关注的并非“能否不生成视频”这一已有部分工作解答的问题,而是更具体的课题:由真实未来诱发的生成器内部计算,能否监督一个仅从当下场景推断、不会被动作损失重新塑造、同时仍能被生成器利用的预测表示?

核心洞见:不只学习未来的样子,更要学习生成的过程

为什么不直接预测未来像素、动作,或是冻结图像编码器的未来特征?动作标签仅描述机器人的执行动作,对物体状态、接触变化和场景演化的监督较为间接;未来像素虽然信息完整,但会将任务相关变化与光照、纹理、采样噪声混在一起;冻结的图像编码器特征更紧凑,但这类特征最初是为静态视觉语义任务设计的,未必能主动组织长时域的交互变化。

世界生成模型的内部状态恰好介于两者之间:它们不是最终渲染出的像素,但参与了未来从噪声逐步演变为连贯轨迹的全过程。浅层状态更容易保留外观与局部几何信息,中间层会逐步建立对象关系和运动结构,深层状态则更接近全局布局与交互结果。不同层级、不同生成扰动阶段的状态,因此提供了一组互补的预测目标。

预实验揭示了两个关键现象:第一,生成器状态确实包含任务和未来变化的相关信息;第二,这些信息的有效性与稳定性会随着网络深度和扰动水平发生变化。固定选取某一层状态会丢失这种互补性,因此Enfold会预测多个生成器层级,并让预测头显式感知生成时间步,从而在同一表示中吸收局部外观、空间关系与长程交互结构。

这里还有一个更关键的学习机制:教师模型能够看到真实发生的未来和生成噪声,而学生模型只能看到当前的视觉上下文与语言指令。学生不可能逐项复制教师中的所有变化,只能学习在给定当前条件下稳定可预测的部分。这种信息不对称并非缺陷,而是一种筛选机制——由未来和噪声造成、无法从当前场景判断的偶然成分会被抑制,而由当前状态和任务决定的转移结构则更容易保留下来。在平方误差的视角下,学生趋向于预测“给定当前上下文后,教师表示的条件期望”,本文采用的Smooth L1目标则可以理解为更稳健的条件中心估计,这也解释了为什么Enfold并不追求还原某一次随机生成的未来,而是试图提取跨可能未来共享、且与当前决策相关的结构。

Enfold的实现逻辑:将未来折叠进当前表示

Enfold的训练过程可以概括为四个相互配合的环节:

  1. Generator-to-Representation(G2R):世界生成模型在教师强制条件下处理真实未来,并暴露多个层级的隐藏状态;仅观察当前场景与指令的编码器学习预测这些状态。
  2. Representation-to-Generator(R2G):预测表示经过梯度隔离后重新输入生成器,帮助其按需展开未来。这要求表示不仅对动作控制有用,也必须保留生成器能够理解的预测结构。
  3. 与任务梯度解耦:动作头读取经过停止梯度处理的表示,任务损失不会反向将编码器改造成仅迎合某一动作数据集的特征。表示由生成式预测目标塑造,控制模块则学习如何读取该表示。
  4. 部署时移除生成器:在线控制流程仅运行当前编码器和动作头。生成器仍参与训练,也可以在分析或可视化时按需调用,但不再为每一个动作块支付生成成本。

Enfold与Fast-WAM的核心区别并非仅在于推理时跳过显式未来视频生成,而是体现在三个维度:表示的来源、塑造表示的梯度类型,以及该表示能否作为生成与控制之间的独立接口。下表对比了两者的关键差异:

对比维度 Fast-WAM Enfold
训练组织 视频预测与动作学习位于耦合的世界—动作架构中 教师生成器定义多层监督,独立编码器从当前上下文预测
表示接口 服务联合世界—动作学习 同一表示可被动作头读取,也可反馈给生成器
动作梯度是否塑造预测表示 与联合训练目标耦合 否,任务读出与表示学习通过停止梯度隔离
控制时是否生成视频
控制时是否执行世界生成器
方法核心 高效的联合视频—动作建模 将未来条件的生成器计算迁移为当前可推断的预测表示

实验验证:不运行生成器,控制性能依然可靠

研究团队从单臂模拟、双臂模拟扩展到真实双臂操作场景进行验证:LIBERO基准覆盖4个标准套件和40项任务;RoboTwin2.0包含50项双臂任务,同时测试干净场景与结构化随机场景;真机实验则在AgileX双臂平台上评估4项桌面操作任务。所有方法的延迟均在NVIDIA A100 40GB GPU上统一测量。

LIBERO基准:延迟与精度的平衡

方法 参数量 动作块延迟 LIBERO 平均成功率 相对 Fast-WAM 速度
Fast-WAM 6B 基准 97.6% 1.0×
Enfold 3B 134 ms 97.8% 3.7×
Enfold-Flash 3B 49 ms 97.5% 10.1×

LIBERO上的强方法已经接近性能饱和,因此97.8%相对97.6%的差异不应被过度夸大。更关键的结果是:Enfold仅用约一半参数量就将延迟降至134毫秒,达到Fast-WAM的3.7倍速度;采用TensorRT算子优化的Enfold-Flash进一步将延迟降至49毫秒,达到10.1倍速度,而平均成功率仅比标准版低0.3个百分点。在更强调长程、多阶段交互的LIBERO-10上,Enfold达到97.4%,比Fast-WAM高2.2个百分点。标准版与Flash版分别体现了两层效率来源:前者来自表示接口本身——生成器不在控制路径中;后者来自部署层面的算子优化。低延迟并非孤立的工程数字,它意味着策略可以在相同时间预算内更频繁地重新读取环境、更新动作块。

RoboTwin2.0:跨机器人形态的通用性

方法 Clean场景得分 Randomized场景得分 平均得分
Fast-WAM 91.88% 91.78% 91.83%
LingBot-VA 92.90% 91.50% 92.20%
Enfold 91.60% 91.94% 91.77%
Enfold-Flash 91.96% 92.08% 92.02%

Enfold-Flash在随机化场景中达到92.08%,综合平均分为92.02%。它与Fast-WAM、LingBot-VA的总体差距都很小,因此这组实验更适合证明“高效接口可以跨越单臂与双臂形态而不损失整体能力”,而非作绝对排名声明。需要注意的是,LingBot-VA使用了具身预训练,而Enfold与Fast-WAM在该实验设置中没有使用具身预训练,两类结果需要结合训练条件综合理解。

真实双臂实验:场景变化后的闭环表现

真机实验包括叠毛巾、整理桌面、舀取粉末和收纳盘子四项任务。训练集由400段示范构成;每个方法在每个任务和评估条件下执行30次独立rollout,并以分阶段完成度计算归一化分数。OOD设置会改变物体外观、材料、对象集合或环境条件。

方法 ID 平均得分 OOD 平均得分
Motus 50.8% 38.0%
π0.5 86.1% 83.3%
Fast-WAM 77.8% 70.0%
Enfold 89.7% 76.6%
Enfold-Flash 85.0% 73.3%

相较Fast-WAM,Enfold的ID平均分提高11.9个百分点,OOD平均分提高6.6个百分点。其中,叠毛巾、舀取粉末和收纳盘子分别提高18.9、15.5和13.3个百分点,整理桌面任务的成绩持平。这说明效率改造没有把模型退化为仅在模拟基准上有效的轻量策略。与此同时,OOD结果也给出了清晰边界:Enfold的76.6%仍低于π0.5的83.3%。换言之,Enfold在当前训练协议下显著改善了世界模型路线的真实场景迁移能力,但更大规模的具身预训练在强分布偏移场景下仍有优势。

动态场景下的重规划能力

仅靠成功率无法判断策略是在根据当前状态重规划,还是在近似复现训练轨迹。为此,研究人员在收纳盘子和叠毛巾的执行过程中人为改变环境,同时保持原始语言指令不变。

在收纳盘子任务中,目标盘子被移动后,模型不再延续原来的末端轨迹,而是将夹爪重新引向盘子的新位置;在叠毛巾任务中,布料几何状态被打乱后,策略会重新建立接触并继续折叠。更值得注意的是,按需生成的未来和真实执行的动作发生了协调变化:模型“想象”的后续场景并没有停留在干预前的世界,动作也没有沿旧轨迹强行推进。

这组现象支持一种克制但重要的判断:Enfold学到的不是固定轨迹回放,而是以当前状态为条件的重规划。它体现了干预条件下的反事实一致性——当“现在”被替换为另一种可能状态时,模型会给出与新状态相容的未来和行动。但由于当前证据是定性的、干预类型也有限,它还不能等同于对一般因果反事实推理能力的完整证明。

双向耦合的关键作用

多层生成器状态的优势

研究团队保持后续动作学习协议不变,仅替换预测表示所使用的训练信号,验证不同监督方式的效果:

表示监督方式 Spatial得分 Object得分 Goal得分 LIBERO-10得分 平均得分
未来像素 98.0 99.8 91.8 94.2 96.0
仅动作标签 97.6 99.6 92.8 89.6 94.9
单层生成器状态 96.8 99.8 94.0 94.6 96.3
多层生成器状态 97.0 100.0 96.8 97.4 97.8

未来像素在Spatial维度上仍领先1.0个百分点,说明细粒度空间外观并非在所有任务上都应被彻底舍弃。但多层生成器状态在Goal与LIBERO-10任务上均比单层状态提高2.8个百分点,并取得最高的平均得分。这与方法动机吻合:长程目标和多阶段操作需要同时保留局部几何、对象关系与任务进展,单一生成深度难以覆盖全部信息。

表示对生成未来的辅助作用

如果Enfold表示只是动作头的专用摘要,它未必能帮助世界生成模型。R2G实验将该表示重新反馈给生成器,在相同视觉与语言条件下比较未来视频质量:

生成条件 PSNR ↑ SSIM ↑ LPIPS ↓
原始条件 25.92 0.885 0.0550
加入 Enfold 表示 27.27 0.902 0.0483

加入Enfold表示后,PSNR提高1.35 dB,SSIM提高0.017,LPIPS降低12.2%。由于模型没有获得额外的视觉观测,这一提升不能归因于新增视觉信息;更合理的解释是,Enfold将当前上下文重组为生成器更容易读取的预测结构。G2R环节证明生成器能够教会当前编码器,R2G环节则证明学生学到的表示仍与生成器的未来空间兼容。

表示的内在特性分析

稳定而非坍缩:过滤噪声同时保留有效信息

任务性能并不能排除两个平凡解释:学生可能只是复制教师的随机扰动;或者它仍然只是一个静态视觉表示,未来监督并未真正改变其组织方式。论文通过噪声敏感性、任务检索与有效秩进行诊断:

诊断指标 生成器内部状态 Enfold 表示 结论
对随机扰动的敏感度 0.157–0.208 0.020 Enfold表示的敏感度低7.9–10.4倍
最高有效秩 10.7 31.8 Enfold表示的有效秩更高,未发生特征坍缩
任务检索mAP 0.486 表示保留了可区分的任务结构

如果学生只是照搬教师,它应继承相近的噪声敏感性;如果稳定性来自特征坍缩,它的有效秩又应明显降低。实际结果恰好相反:Enfold表示对随机变化更稳定,同时覆盖更丰富的有效方向。这与前述“条件过滤”机制一致——不可从当前场景预测的教师扰动被抑制,可跨未来复用的结构被重新组织。

聚焦交互区域:随时间增长的优势

研究团队进一步训练轻量探针,从当前表示预测未来图像特征,并与冻结DINO特征进行比较:

预测位置 未来时间t=1 t=16 t=32
变化最明显的局部区域:余弦残差相对降低 4.6% 18.1% 18.2%
全局特征:余弦残差相对降低 略低于DINO 14.0% 15.2%

这一结果很有辨识力:如果Enfold只是一个普遍更强的当前图像编码器,它在最近一帧和全局区域也应全面占优;事实上,对几乎尚未发生变化的t=1全局特征,它略逊于冻结DINO。到t=16和t=32,优势才明显扩大,并集中于场景中真正发生交互的区域。这个短时例外反而说明,该表示被定向组织用于预测未来变化,而不是简单提升静态视觉描述能力。

从外观相似到交互相关的相似性

在真实场景和LIBERO基准中,以夹爪附近的特征作为查询,冻结DINO主要响应机械臂上外观相似的区域;而Enfold的高相似区域则进一步延伸到被操作物体和接触位置。这并不意味着单张可视化可以证明因果关系,但它与未来探针的定量结果相互印证:表示的相似性结构已经从纯外观邻近,部分转向了交互相关性。

这项工作不止是“加速工具”

Enfold的效率结果很醒目,但它更深层的改变是重新定义了世界生成模型在具身系统中的角色: - 传统接口将生成器视为“动作时模拟器”,每次决策都需要运行它; - Enfold将生成器转变为“训练时的结构化教师”,让它构造未来的方式沉淀到当前的表示中; - 该表示既能被动作头低成本读取,也能在需要解释或分析时重新展开为视觉未来。

由此,模型不必在“具有未来意识”和“满足实时控制”之间二选一。未来建模仍然影响每次动作,但昂贵的生成过程不必在每次动作前重复发生。对于需要频繁闭环重规划的机器人而言,这种接口变化往往比单次前向的参数压缩更重要。

这一思路也可能超出机器人控制本身:当一个高成本生成模型已经学会如何组织复杂输出,下游任务未必需要不断请求完整生成结果,也可以学习其内部计算中可由当前条件预测的部分,再通过轻量接口服务检索、规划或交互。

实现与训练概览

论文将主要实现细节放在附录中,下表给出理解计算规模所需的关键信息:

项目 LIBERO 真机实验 RoboTwin2.0
预测视觉编码器 DINOv3 ViT-H+/16 DINOv3 ViT-H+/16 DINOv3 ViT-H+/16
世界生成模型 Cosmos-Predict 2.5 2B Cosmos-Predict 2.5 2B Cosmos-Predict 2.5 2B
视觉视角数 2 1 3
动作头层数 10 10 16
动作块长度 32 32 32
重规划步长 10 10 24
训练硬件 8× A100 40GB 8× A100 40GB 32× A100 40GB
训练时间 23 小时 44 小时 108 小时

所有模型使用bf16精度和AdamW优化器训练。生成器仅在训练与按需可视化时使用;控制延迟统计对应部署路径中的预测编码器与动作头。

研究的边界与未来方向

Enfold给出了一条将生成式未来知识迁移到实时控制的可行路径,但论文也保留了几项明确的边界:

  1. 训练成本并未消失:世界生成模型仍需要在训练阶段运行,Enfold优化的是部署时的控制路径,而非完全摆脱生成器。
  2. 干预证据仍以定性为主:想象与动作会随当前状态共同更新,但要声称一般性的反事实推理能力,还需要更系统的干预集合、可量化指标和因果对照实验。
  3. 部分基准已接近饱和:RoboTwin2.0上多个强方法的平均差距不到半个百分点,后续工作应报告更多重复训练的置信区间,并使用更具区分度的长程任务。
  4. 强OOD泛化仍有提升空间:真机OOD场景中,Enfold超过Fast-WAM,但仍落后于使用更强具身预训练的π0.5。扩大训练分布、结合大规模预训练和显式不确定性建模,是自然的下一步方向。

结语

世界模型的价值,未必只存在于它最终生成的那段视频里。生成器在构造未来时形成的内部计算,本身就是一种关于“接下来会怎样”的丰富监督。Enfold将这种监督压缩进一个由当下直接推断的表示中,让机器人在不反复运行生成器的前提下,仍能依据未来结构行动,并在场景改变后重新组织想象与控制。

这项工作的核心可以归结为一句话:不是让机器人每一步都重新生成未来,而是让未来的生成过程改变它理解当下的方式。

以上内容不代表本平台立场,仅供读者参考