Enfold:具身智能高效世界模型与控制解耦方案

机器人在执行具身任务时,需要精准预判动作后的场景变化、接触关系演化以及长程任务的推进节点。世界生成模型能够合成可视化的未来场景,为机器人提供“想象未来”的能力,但如果每次动作决策都需要完整运行一次视频生成流程,这种“想象”本身就会成为实时控制的沉重负担。来自上海交通大学与齐鲁工业大学(山东省科学院)的研究团队提出的Enfold方案,正是为了解决这一痛点:它不再将世界生成模型仅仅视为需要反复调用的未来模拟器,而是将生成器构造未来时产生的多层内部计算,转化为一种可以直接从当前场景推断、同时服务于控制与生成任务的表示形式。通过这种方式,未来信息在训练阶段被“折叠”进当下的表示中,部署时就无需让生成器进入动作控制回路。
该研究的完整信息如下: 论文标题:Enfold: Folding World Model Imagination into Predictive Representations for Ultra-Efficient Embodied Control 论文链接:https://arxiv.org/html/2607.26657v2 项目主页:https://zwl666666.github.io/enfold/ 代码仓库:https://github.com/zwl666666/enfold 作者团队包括曾伟力、行义通(共同第一作者),刘福龙、杨成群等多位研究者,通讯作者为晏轶超。
| 指标 | 数值 |
|---|---|
| LIBERO 平均成功率 | 97.8% |
| Enfold 动作块延迟 | 134 ms(Fast-WAM 的 3.7× 速度) |
| Enfold-Flash 动作块延迟 | 49 ms(Fast-WAM 的 10.1× 速度) |
| 真机 ID / OOD 平均完成分数 | 89.7% / 76.6% |
实时控制的核心瓶颈:生成式模拟的延迟代价
现有基于世界模型的具身控制方案大致可以分为五类,不同方案的接口设计决定了生成式计算是否会进入控制回路:
| 方案类型 | 未来信息接入方式 | 部署时是否运行生成路径 | 核心特点与限制 |
|---|---|---|---|
| 未来像素/视频监督 | 编码器或策略直接预测未来画面 | 不一定 | 目标直观,但像素包含大量与动作无关的纹理和随机细节 |
| Imagine-then-Act | 先生成视觉未来,再据此预测动作 | 是 | 未来显式可解释,但生成成本进入每次决策流程 |
| 生成缓存或隐藏状态 | 动作头读取生成分支的中间结果 | 是 | 避免完整视频解码,但仍依赖在线生成计算 |
| Fast-WAM 类联合架构 | 联合学习视频与动作,可跳过显式未来生成 | 否 | 已证明无需输出视频也能行动,但视频与动作仍在耦合架构中共同塑造特征 |
| Enfold | 当前编码器预测真实未来诱发的多层生成器状态 | 否 | 将生成器作为训练时的教师,形成与动作学习解耦、又可反馈给生成器的表示接口 |
Enfold 关注的并非“能否不生成视频”这一已有部分工作解答的问题,而是更具体的课题:由真实未来诱发的生成器内部计算,能否监督一个仅从当下场景推断、不会被动作损失重新塑造、同时仍能被生成器利用的预测表示?
核心洞见:不只学习未来的样子,更要学习生成的过程
为什么不直接预测未来像素、动作,或是冻结图像编码器的未来特征?动作标签仅描述机器人的执行动作,对物体状态、接触变化和场景演化的监督较为间接;未来像素虽然信息完整,但会将任务相关变化与光照、纹理、采样噪声混在一起;冻结的图像编码器特征更紧凑,但这类特征最初是为静态视觉语义任务设计的,未必能主动组织长时域的交互变化。
世界生成模型的内部状态恰好介于两者之间:它们不是最终渲染出的像素,但参与了未来从噪声逐步演变为连贯轨迹的全过程。浅层状态更容易保留外观与局部几何信息,中间层会逐步建立对象关系和运动结构,深层状态则更接近全局布局与交互结果。不同层级、不同生成扰动阶段的状态,因此提供了一组互补的预测目标。
预实验揭示了两个关键现象:第一,生成器状态确实包含任务和未来变化的相关信息;第二,这些信息的有效性与稳定性会随着网络深度和扰动水平发生变化。固定选取某一层状态会丢失这种互补性,因此Enfold会预测多个生成器层级,并让预测头显式感知生成时间步,从而在同一表示中吸收局部外观、空间关系与长程交互结构。
这里还有一个更关键的学习机制:教师模型能够看到真实发生的未来和生成噪声,而学生模型只能看到当前的视觉上下文与语言指令。学生不可能逐项复制教师中的所有变化,只能学习在给定当前条件下稳定可预测的部分。这种信息不对称并非缺陷,而是一种筛选机制——由未来和噪声造成、无法从当前场景判断的偶然成分会被抑制,而由当前状态和任务决定的转移结构则更容易保留下来。在平方误差的视角下,学生趋向于预测“给定当前上下文后,教师表示的条件期望”,本文采用的Smooth L1目标则可以理解为更稳健的条件中心估计,这也解释了为什么Enfold并不追求还原某一次随机生成的未来,而是试图提取跨可能未来共享、且与当前决策相关的结构。
Enfold的实现逻辑:将未来折叠进当前表示
Enfold的训练过程可以概括为四个相互配合的环节:
- Generator-to-Representation(G2R):世界生成模型在教师强制条件下处理真实未来,并暴露多个层级的隐藏状态;仅观察当前场景与指令的编码器学习预测这些状态。
- Representation-to-Generator(R2G):预测表示经过梯度隔离后重新输入生成器,帮助其按需展开未来。这要求表示不仅对动作控制有用,也必须保留生成器能够理解的预测结构。
- 与任务梯度解耦:动作头读取经过停止梯度处理的表示,任务损失不会反向将编码器改造成仅迎合某一动作数据集的特征。表示由生成式预测目标塑造,控制模块则学习如何读取该表示。
- 部署时移除生成器:在线控制流程仅运行当前编码器和动作头。生成器仍参与训练,也可以在分析或可视化时按需调用,但不再为每一个动作块支付生成成本。
Enfold与Fast-WAM的核心区别并非仅在于推理时跳过显式未来视频生成,而是体现在三个维度:表示的来源、塑造表示的梯度类型,以及该表示能否作为生成与控制之间的独立接口。下表对比了两者的关键差异:
| 对比维度 | Fast-WAM | Enfold |
|---|---|---|
| 训练组织 | 视频预测与动作学习位于耦合的世界—动作架构中 | 教师生成器定义多层监督,独立编码器从当前上下文预测 |
| 表示接口 | 服务联合世界—动作学习 | 同一表示可被动作头读取,也可反馈给生成器 |
| 动作梯度是否塑造预测表示 | 与联合训练目标耦合 | 否,任务读出与表示学习通过停止梯度隔离 |
| 控制时是否生成视频 | 否 | 否 |
| 控制时是否执行世界生成器 | 否 | 否 |
| 方法核心 | 高效的联合视频—动作建模 | 将未来条件的生成器计算迁移为当前可推断的预测表示 |
实验验证:不运行生成器,控制性能依然可靠
研究团队从单臂模拟、双臂模拟扩展到真实双臂操作场景进行验证:LIBERO基准覆盖4个标准套件和40项任务;RoboTwin2.0包含50项双臂任务,同时测试干净场景与结构化随机场景;真机实验则在AgileX双臂平台上评估4项桌面操作任务。所有方法的延迟均在NVIDIA A100 40GB GPU上统一测量。
LIBERO基准:延迟与精度的平衡
| 方法 | 参数量 | 动作块延迟 | LIBERO 平均成功率 | 相对 Fast-WAM 速度 |
|---|---|---|---|---|
| Fast-WAM | 6B | 基准 | 97.6% | 1.0× |
| Enfold | 3B | 134 ms | 97.8% | 3.7× |
| Enfold-Flash | 3B | 49 ms | 97.5% | 10.1× |
LIBERO上的强方法已经接近性能饱和,因此97.8%相对97.6%的差异不应被过度夸大。更关键的结果是:Enfold仅用约一半参数量就将延迟降至134毫秒,达到Fast-WAM的3.7倍速度;采用TensorRT算子优化的Enfold-Flash进一步将延迟降至49毫秒,达到10.1倍速度,而平均成功率仅比标准版低0.3个百分点。在更强调长程、多阶段交互的LIBERO-10上,Enfold达到97.4%,比Fast-WAM高2.2个百分点。标准版与Flash版分别体现了两层效率来源:前者来自表示接口本身——生成器不在控制路径中;后者来自部署层面的算子优化。低延迟并非孤立的工程数字,它意味着策略可以在相同时间预算内更频繁地重新读取环境、更新动作块。
RoboTwin2.0:跨机器人形态的通用性
| 方法 | Clean场景得分 | Randomized场景得分 | 平均得分 |
|---|---|---|---|
| Fast-WAM | 91.88% | 91.78% | 91.83% |
| LingBot-VA | 92.90% | 91.50% | 92.20% |
| Enfold | 91.60% | 91.94% | 91.77% |
| Enfold-Flash | 91.96% | 92.08% | 92.02% |
Enfold-Flash在随机化场景中达到92.08%,综合平均分为92.02%。它与Fast-WAM、LingBot-VA的总体差距都很小,因此这组实验更适合证明“高效接口可以跨越单臂与双臂形态而不损失整体能力”,而非作绝对排名声明。需要注意的是,LingBot-VA使用了具身预训练,而Enfold与Fast-WAM在该实验设置中没有使用具身预训练,两类结果需要结合训练条件综合理解。
真实双臂实验:场景变化后的闭环表现
真机实验包括叠毛巾、整理桌面、舀取粉末和收纳盘子四项任务。训练集由400段示范构成;每个方法在每个任务和评估条件下执行30次独立rollout,并以分阶段完成度计算归一化分数。OOD设置会改变物体外观、材料、对象集合或环境条件。
| 方法 | ID 平均得分 | OOD 平均得分 |
|---|---|---|
| Motus | 50.8% | 38.0% |
| π0.5 | 86.1% | 83.3% |
| Fast-WAM | 77.8% | 70.0% |
| Enfold | 89.7% | 76.6% |
| Enfold-Flash | 85.0% | 73.3% |
相较Fast-WAM,Enfold的ID平均分提高11.9个百分点,OOD平均分提高6.6个百分点。其中,叠毛巾、舀取粉末和收纳盘子分别提高18.9、15.5和13.3个百分点,整理桌面任务的成绩持平。这说明效率改造没有把模型退化为仅在模拟基准上有效的轻量策略。与此同时,OOD结果也给出了清晰边界:Enfold的76.6%仍低于π0.5的83.3%。换言之,Enfold在当前训练协议下显著改善了世界模型路线的真实场景迁移能力,但更大规模的具身预训练在强分布偏移场景下仍有优势。
动态场景下的重规划能力
仅靠成功率无法判断策略是在根据当前状态重规划,还是在近似复现训练轨迹。为此,研究人员在收纳盘子和叠毛巾的执行过程中人为改变环境,同时保持原始语言指令不变。
在收纳盘子任务中,目标盘子被移动后,模型不再延续原来的末端轨迹,而是将夹爪重新引向盘子的新位置;在叠毛巾任务中,布料几何状态被打乱后,策略会重新建立接触并继续折叠。更值得注意的是,按需生成的未来和真实执行的动作发生了协调变化:模型“想象”的后续场景并没有停留在干预前的世界,动作也没有沿旧轨迹强行推进。
这组现象支持一种克制但重要的判断:Enfold学到的不是固定轨迹回放,而是以当前状态为条件的重规划。它体现了干预条件下的反事实一致性——当“现在”被替换为另一种可能状态时,模型会给出与新状态相容的未来和行动。但由于当前证据是定性的、干预类型也有限,它还不能等同于对一般因果反事实推理能力的完整证明。
双向耦合的关键作用
多层生成器状态的优势
研究团队保持后续动作学习协议不变,仅替换预测表示所使用的训练信号,验证不同监督方式的效果:
| 表示监督方式 | Spatial得分 | Object得分 | Goal得分 | LIBERO-10得分 | 平均得分 |
|---|---|---|---|---|---|
| 未来像素 | 98.0 | 99.8 | 91.8 | 94.2 | 96.0 |
| 仅动作标签 | 97.6 | 99.6 | 92.8 | 89.6 | 94.9 |
| 单层生成器状态 | 96.8 | 99.8 | 94.0 | 94.6 | 96.3 |
| 多层生成器状态 | 97.0 | 100.0 | 96.8 | 97.4 | 97.8 |
未来像素在Spatial维度上仍领先1.0个百分点,说明细粒度空间外观并非在所有任务上都应被彻底舍弃。但多层生成器状态在Goal与LIBERO-10任务上均比单层状态提高2.8个百分点,并取得最高的平均得分。这与方法动机吻合:长程目标和多阶段操作需要同时保留局部几何、对象关系与任务进展,单一生成深度难以覆盖全部信息。
表示对生成未来的辅助作用
如果Enfold表示只是动作头的专用摘要,它未必能帮助世界生成模型。R2G实验将该表示重新反馈给生成器,在相同视觉与语言条件下比较未来视频质量:
| 生成条件 | PSNR ↑ | SSIM ↑ | LPIPS ↓ |
|---|---|---|---|
| 原始条件 | 25.92 | 0.885 | 0.0550 |
| 加入 Enfold 表示 | 27.27 | 0.902 | 0.0483 |
加入Enfold表示后,PSNR提高1.35 dB,SSIM提高0.017,LPIPS降低12.2%。由于模型没有获得额外的视觉观测,这一提升不能归因于新增视觉信息;更合理的解释是,Enfold将当前上下文重组为生成器更容易读取的预测结构。G2R环节证明生成器能够教会当前编码器,R2G环节则证明学生学到的表示仍与生成器的未来空间兼容。
表示的内在特性分析
稳定而非坍缩:过滤噪声同时保留有效信息
任务性能并不能排除两个平凡解释:学生可能只是复制教师的随机扰动;或者它仍然只是一个静态视觉表示,未来监督并未真正改变其组织方式。论文通过噪声敏感性、任务检索与有效秩进行诊断:
| 诊断指标 | 生成器内部状态 | Enfold 表示 | 结论 |
|---|---|---|---|
| 对随机扰动的敏感度 | 0.157–0.208 | 0.020 | Enfold表示的敏感度低7.9–10.4倍 |
| 最高有效秩 | 10.7 | 31.8 | Enfold表示的有效秩更高,未发生特征坍缩 |
| 任务检索mAP | — | 0.486 | 表示保留了可区分的任务结构 |
如果学生只是照搬教师,它应继承相近的噪声敏感性;如果稳定性来自特征坍缩,它的有效秩又应明显降低。实际结果恰好相反:Enfold表示对随机变化更稳定,同时覆盖更丰富的有效方向。这与前述“条件过滤”机制一致——不可从当前场景预测的教师扰动被抑制,可跨未来复用的结构被重新组织。
聚焦交互区域:随时间增长的优势
研究团队进一步训练轻量探针,从当前表示预测未来图像特征,并与冻结DINO特征进行比较:
| 预测位置 | 未来时间t=1 | t=16 | t=32 |
|---|---|---|---|
| 变化最明显的局部区域:余弦残差相对降低 | 4.6% | 18.1% | 18.2% |
| 全局特征:余弦残差相对降低 | 略低于DINO | 14.0% | 15.2% |
这一结果很有辨识力:如果Enfold只是一个普遍更强的当前图像编码器,它在最近一帧和全局区域也应全面占优;事实上,对几乎尚未发生变化的t=1全局特征,它略逊于冻结DINO。到t=16和t=32,优势才明显扩大,并集中于场景中真正发生交互的区域。这个短时例外反而说明,该表示被定向组织用于预测未来变化,而不是简单提升静态视觉描述能力。
从外观相似到交互相关的相似性
在真实场景和LIBERO基准中,以夹爪附近的特征作为查询,冻结DINO主要响应机械臂上外观相似的区域;而Enfold的高相似区域则进一步延伸到被操作物体和接触位置。这并不意味着单张可视化可以证明因果关系,但它与未来探针的定量结果相互印证:表示的相似性结构已经从纯外观邻近,部分转向了交互相关性。
这项工作不止是“加速工具”
Enfold的效率结果很醒目,但它更深层的改变是重新定义了世界生成模型在具身系统中的角色: - 传统接口将生成器视为“动作时模拟器”,每次决策都需要运行它; - Enfold将生成器转变为“训练时的结构化教师”,让它构造未来的方式沉淀到当前的表示中; - 该表示既能被动作头低成本读取,也能在需要解释或分析时重新展开为视觉未来。
由此,模型不必在“具有未来意识”和“满足实时控制”之间二选一。未来建模仍然影响每次动作,但昂贵的生成过程不必在每次动作前重复发生。对于需要频繁闭环重规划的机器人而言,这种接口变化往往比单次前向的参数压缩更重要。
这一思路也可能超出机器人控制本身:当一个高成本生成模型已经学会如何组织复杂输出,下游任务未必需要不断请求完整生成结果,也可以学习其内部计算中可由当前条件预测的部分,再通过轻量接口服务检索、规划或交互。
实现与训练概览
论文将主要实现细节放在附录中,下表给出理解计算规模所需的关键信息:
| 项目 | LIBERO | 真机实验 | RoboTwin2.0 |
|---|---|---|---|
| 预测视觉编码器 | DINOv3 ViT-H+/16 | DINOv3 ViT-H+/16 | DINOv3 ViT-H+/16 |
| 世界生成模型 | Cosmos-Predict 2.5 2B | Cosmos-Predict 2.5 2B | Cosmos-Predict 2.5 2B |
| 视觉视角数 | 2 | 1 | 3 |
| 动作头层数 | 10 | 10 | 16 |
| 动作块长度 | 32 | 32 | 32 |
| 重规划步长 | 10 | 10 | 24 |
| 训练硬件 | 8× A100 40GB | 8× A100 40GB | 32× A100 40GB |
| 训练时间 | 23 小时 | 44 小时 | 108 小时 |
所有模型使用bf16精度和AdamW优化器训练。生成器仅在训练与按需可视化时使用;控制延迟统计对应部署路径中的预测编码器与动作头。
研究的边界与未来方向
Enfold给出了一条将生成式未来知识迁移到实时控制的可行路径,但论文也保留了几项明确的边界:
- 训练成本并未消失:世界生成模型仍需要在训练阶段运行,Enfold优化的是部署时的控制路径,而非完全摆脱生成器。
- 干预证据仍以定性为主:想象与动作会随当前状态共同更新,但要声称一般性的反事实推理能力,还需要更系统的干预集合、可量化指标和因果对照实验。
- 部分基准已接近饱和:RoboTwin2.0上多个强方法的平均差距不到半个百分点,后续工作应报告更多重复训练的置信区间,并使用更具区分度的长程任务。
- 强OOD泛化仍有提升空间:真机OOD场景中,Enfold超过Fast-WAM,但仍落后于使用更强具身预训练的π0.5。扩大训练分布、结合大规模预训练和显式不确定性建模,是自然的下一步方向。
结语
世界模型的价值,未必只存在于它最终生成的那段视频里。生成器在构造未来时形成的内部计算,本身就是一种关于“接下来会怎样”的丰富监督。Enfold将这种监督压缩进一个由当下直接推断的表示中,让机器人在不反复运行生成器的前提下,仍能依据未来结构行动,并在场景改变后重新组织想象与控制。
这项工作的核心可以归结为一句话:不是让机器人每一步都重新生成未来,而是让未来的生成过程改变它理解当下的方式。

