文章摘要
国内具身智能研发团队联合清华大学课题组推出面向工业场景的新型世界模型ActEffect,创新采用“训练即退”思路:世界模型仅在训练阶段通过动作后果推演优化机器人策略,部署时退出链路,大幅降低算力时延成本。该模型多项测试表现优于同类方案,目前已完成汽车工业场景初步验证,正推进商业落地。

在具身智能的研发流程中,世界模型常被视作机器人随身携带的“脑内沙盘”——机器人会借助它提前推演动作可能带来的后果,再据此规划下一步操作,不过推演越细致,对应的推理链路也就越长,会带来额外的算力和时延成本。但近期推出的一款世界模型方案却打破了这一常规逻辑,它只在训练阶段参与机器人的学习过程,等到机器人正式投入作业时,便会主动从部署链路中退出,最终反而让机器人的实际作业能力得到了显著提升。

这款方案由国内具身智能研发团队联合清华大学相关课题组推出,被命名为Phi-WM 1.0 ActEffect(下文简称ActEffect),它试图解决具身智能领域长期存在的一个核心矛盾:机器人通过演示数据学会了动作的基本形态,但如何利用动作可能带来的实际后果,反过来优化自身的动作策略?

机器人从演示数据里学会了动作长什么样,能否进一步利用动作可能造成的后果,反过来改善自己的策略?

这一问题最终需要落地到真实的工业场景中。传统工业机器人每多运行一层模型推理,就会对应新增的时延、算力投入和运维成本。如果世界模型能够只在训练阶段发挥作用,在执行阶段保持轻量无负担,那么技术价值才能真正转化为可落地的部署价值。

从公开的测试结果来看,这一方案的表现超出了预期。在LIBERO基准测试中,ActEffect取得了98.8%的平均任务成功率,仅比同类型方案高出0.2个百分点,但更关键的是,引入后果反馈后,机器人的基础操作能力并未出现退化;在加入七类分布偏移的LIBERO-PLUS测试中,ActEffect的平均成功率达到80.3%,远超对比方案的51.5%;而在29维动作空间的RoboCasa-GR1测试中,面对拥有双臂、灵巧手和腰部自由度的GR-1人形机器人,ActEffect的平均成功率达到67.5%,比第二名高出9.2个百分点,比Fast-WAM高出10.8个百分点,在高维度动作空间的复杂任务中,后果反馈的优势体现得尤为明显。

ActEffect的技术突破,本质上是对传统模仿学习范式的优化。当前多数通用机器人策略都基于VLA框架构建,通过摄像头获取视觉信息、结合语言指令生成动作,训练过程中以和示范动作的相似度作为评分标准。但在真实物理场景中,“动作接近示范”和“结果符合预期”之间往往存在明显差距:夹爪早闭合一毫秒可能导致零件抓握不稳,手腕角度偏移几度就会让插接作业失败,看似细微的数值差别,最终可能带来完全不同的作业结果。

针对这一问题,ActEffect没有继续延长机器人的思考链路,而是让策略同时生成三份完整的动作提案:第一版来自前馈分支,相当于机器人的第一反应;第二版由MIP动作头生成的粗粒度提案;第三版则在第二版的基础上进行精修,最终成为即将执行的动作。这三份提案都具备完整的可执行性,避免了传统扩散、流匹配策略中中间状态带噪、无法直接用于模型推演的问题,让机器人可以在统一的起点下对比不同动作的实际效果。

接下来,受控世界模型正式登场。它会接收当前的视觉状态和单份动作提案,推演该动作执行后场景会发生的变化,三份动作提案需要分别完成一次推演,相当于让机器人在训练环境中提前预览三次执行结果。这里有一个关键的设计细节:语言指令仍由VLA策略处理,用于明确机器人的任务目标,而受控世界模型仅关注当前视觉画面和动作本身,不读取任务语言指令。比如同样是推动杯子,无论指令是“挪开杯子”还是“清理桌面”,模型只会根据当前杯子的位置、周围环境和施加的动作,推演物理变化的结果,不会受到任务语义的干扰。

除此之外,ActEffect还将未来状态的推演限定在冻结的DINOv3视觉特征空间中,它不需要生成逼真的未来画面,只需要捕捉物体的位置、姿态和场景结构的变化,这也是“物理原生”这一概念的核心落点:任务语义由VLA模块处理,而动作带来的物理状态变化则被单独拆分出来进行学习。

推演完成后,还需要将结果反馈给策略进行优化。训练数据中本身就包含动作执行后的真实观测结果,受控世界模型会将三份提案的推演结果与真实未来逐一对比,要求精修后的提案比粗提案更接近真实结果,而粗提案也要优于第一版前馈提案。为了避免模型通过刻意降低差提案的表现来凸显好提案,ActEffect还为排序损失加入了梯度截断,确保训练过程只会推动好的提案更接近真实未来。

经过这样的反馈学习,世界模型对动作后果的判断会被写入策略的权重中。当机器人正式上岗时,受控世界模型和未来推演分支都会被移除,只保留MIP动作头完成粗提案生成和精修,整个部署链路变得极为轻量。

为了验证各模块的有效性,团队还进行了消融实验。当移除后果反馈模块时,LIBERO基准的平均成功率从98.8%下降到97.0%;将DINOv3特征空间替换为VLM表示时,成绩为97.3%;而如果拿掉排序损失,成功率则回落到98.1%。这几组实验结果充分证明了ActEffect训练范式的有效性。

到这里,我们就能理解为什么这款世界模型会选择在部署时退出。在实验室环境中,具身智能的评价维度通常只有任务成功率,但一旦进入真实生产场景,这一评价体系就会发生根本性变化。在仿真环境中多运行一层模型,可能只是表格中的一项计算开销,但将同样的链路搬进汽车工厂,每一次推理都会成为产线的实际成本。不仅如此,当方案从单台机器人复制到几十上百个工位时,额外的显卡投入、功耗成本和维护工作量都会变成实打实的负担。

ActEffect将受控世界模型留在训练阶段,恰好避开了这部分在线开销。它从现有的演示数据中挖掘出了额外的监督信号,让机器人提前获得动作后果的经验,而在正式作业时不需要再背负整套世界模型的计算压力,真正实现了“训练时多想一会儿,部署时轻装上阵”。

选择这一技术路线,和研发团队的落地场景密切相关。汽车制造场景中存在大量散乱件上下料、复杂曲面质检等任务,传统自动化设备通常围绕固定工位开发,一套夹具和轨迹只能服务单一零件,一旦零件位置变化或操作空间变窄,原本稳定的流程就会失效。具身智能正是要填补这一适应性能力的空白。

目前,该团队已经围绕焊接上下料、移动质检等典型高价值工位完成了真实场景验证,并与多家国内外头部汽车企业展开商业合作。在2026年行业展会上,团队将自研的Phi-Bot X1机器人投入到某头部车企的焊接上下料场景中,连续运行3天,累计作业21.5小时,期间零失误、零中断。

ActEffect已经在三项仿真基准上完成了训练验证,而真机验证的接力棒则交到了Phi-Bot X1手中。此前21.5小时的记录来自整套工业具身系统,接下来ActEffect将沿着这条真实链路继续接受验证。值得一提的是,该团队兼具学术研究和汽车产业工程经验:公司成立于2025年4月,由清华大学车辆与运载学院和人工智能学院联合孵化,创始人兼CEO拥有清华大学博士和米兰理工大学博士后背景,此前曾担任知名地图产品的技术负责人,相关技术已进入汽车量产体系;联合创始人长期从事自动驾驶与具身智能研究,多项技术已实现产业应用。

因此,该团队不仅专注于强化学习和世界模型的研发,同时也在搭建机器人本体、数据算法体系和开发平台。在工业场景中,模型只是整套系统的一环,硬件需要能够承受连续运行的压力,系统需要便于部署,出现问题时需要能够快速维护,任何一个环节的缺失都会让算法的纸面成绩无法真正落地到产线。

过去两年,具身智能领域从不缺少令人惊艳的演示视频:机器人可以奔跑、跳跃、叠衣服,也能听懂复杂的语言指令。但一旦进入客户现场,演示视频中的几十秒操作就会被拉长为一天、一个月甚至一整年的连续运行。工厂不会仅凭一项基准测试成绩就签字验收,交付后每一次失败都可能导致产线停摆和维修工单,具身智能企业的差距也正是在这一过程中逐渐拉开。

机器人首先需要在约定时间内完成正式交付,随后还要通过节拍、精度、安全性、故障率等一系列验收指标。通过这一关后,还需要将能力从一个工位迁移到相似工位,从一家工厂复制到更多工厂。随着复制规模的扩大,另一个问题也会随之而来:每更换一个客户,方案需要重新定制多少?部署需要花费多长时间?机器人和算力的投入,能否被节省下来的人力和停线损失覆盖?

这也正是ActEffect将世界模型留在训练场的商业价值所在:如果后果反馈能够让真机上的策略更加稳定,同时又能省去执行阶段的世界模型开销,那么当机器人复制到更多工位时,算力成本不会随着推理链路一同膨胀。对于准备大规模部署的工业系统来说,这比单次演示中多完成一个动作要实在得多。

不过这一推论目前还缺少真机的完整数据支撑。该团队已经完成了部分真实场景验证,并与头部车企达成了商业合作,他们选择的工位有着明确的落地需求,团队兼具的学术和产业经验也让他们有机会继续向交付环节推进。但验收和规模化复制仍需要一关一关地通过:Phi-Bot X1在真实产线上的稳定表现、将同一套能力复用到新的车型、零件和工位、持续压低部署与运维成本,这些都将决定合作的长远发展。

ActEffect这款看似“反骨”的世界模型,已经在训练场中完成了第一轮测试。未来,它需要在产线上顶住节拍、误差和日复一日的连续运行,这才是更具挑战性的一场考试。

随着VLA、WAM等技术边界的不断拓展,各类方案也会互相吸收融合。对客户来说,这些技术缩写终究只是手段,他们是否愿意验收、方案能否快速复制、成本账是否划算,才是更直接的评判标准。

以上内容不代表本平台立场,仅供读者参考