文章摘要
专注真实机器人任务的具身智能研发团队推出DELE-w0.5世界动作模型,该项目已获天使轮融资,相关研究资料与技术论文公开。该模型针对传统视频驱动世界模型的缺陷,改为仅预测动作执行后的最终世界表征,未来表征仅参与训练不进入推理。真机测试显示其任务成功率、推理速度优于多数主流基线,具备初步跨背景泛化能力,为具身智能世界模型提供了新思路。

当机器人准备将爆米花包装放进微波炉时,实验人员意外关上了炉门——此前的训练数据中从未出现过这种场景。但机器人没有放弃任务,而是稳稳握住包装,重新打开炉门继续完成操作。类似的,当微波炉门仅留下狭窄缝隙时,机器人也没有拘泥于训练中学到的把手操作流程,直接用手中的包装推开了炉门。这种基于任务目标的自适应行为调整,正是全新发布的世界动作模型DELE-w0.5的核心展示能力。

这款模型由专注于真实机器人任务进化的具身智能研发团队推出,团队核心成员长期深耕生成式策略、强化学习与具身智能领域,围绕真机任务自主研发了DELE系列具身大脑模型,目前已获得专业投资机构的天使轮融资。

为何传统视频驱动的世界模型会成为机器人控制的负担?

当前主流的机器人基础模型大致分为两大路线。第一条是视觉-语言-动作模型(VLA),这类模型接收语言指令、多视角当前观测与机器人本体状态,直接输出可执行动作:先通过视觉语言模型完成任务规划,再由动作专家将规划解码为控制信号。其优势在于链路直接,但模型仅能学习当前观测与动作的映射关系,动作对环境的影响被隐含编码在参数中,缺乏明确的环境状态预测能力。

第二条路线是世界动作模型(WAM),其中基于视频生成的WAM会同时预测机器人动作与完整的未来视觉轨迹,通过未来画面学习物体运动、空间变化与接触关系,获得更丰富的时空先验。但这类模型的核心问题在于,机器人控制不需要复现每一个中间时刻的视觉细节,只需预测动作执行后的最终环境状态。中间帧仅描述视觉过渡,不仅占用大量模型容量与计算资源,还无法直接刻画动作的物理结果。

以开门任务为例,机器人真正需要达成的是稳定抓住把手、旋转并推开炉门,最终让门保持在指定角度,而非还原机械臂在每个时刻的外观变化。多帧视频的潜在表征远大于动作序列,会增加模型的序列长度、显存占用与训练负担,推理阶段还需要对高维视频与动作潜在表征进行多轮去噪,直接限制了机器人的控制循环速度。近年来虽有研究通过小型视频骨干、稀疏视频token等方式降低开销,但核心建模目标仍未脱离完整视频轨迹的预测。

DELE-w0.5跳出了这一思路,重新思考机器人控制中世界模型的核心预测目标:我们需要的不是完整的未来视频,而是动作执行后的最终世界表征。

开门任务的核心结果是门保持打开状态;向杯中加冰的目标是冰块进入直立杯子,工具回归指定位置;从冰箱取可乐则需要确保目标饮料被取出,且冰箱最终关闭。这些结果都可以通过紧凑的未来世界表征来刻画,而非逐帧的视觉画面。

由此,三类机器人模型形成了清晰的预测差异:VLA仅预测当前条件下的动作,视频式WAM联合预测动作与完整未来视觉轨迹,而DELE-w0.5则联合预测动作与动作完成后的未来世界表征,既保留了环境状态预测的优势,又大幅压缩了需要处理的未来信息,使其更贴近机器人的控制目标。

未来世界表征仅参与训练,推理阶段无需调用

DELE-w0.5采用双流Transformer架构,整体流程分为训练与推理两个阶段。

训练阶段中,模型接收语言指令、机器人多视角图像与本体状态:语言指令由Qwen3编码,视觉信息由DINO-v3编码,包含头部视角与两个腕部视角。在动作侧,模型一次预测长度为60的动作序列,针对Astribot S1双臂机器人,每个时间步包含14维动作,覆盖两只机械臂的位置、姿态与夹爪状态。

模型内部包含条件流与噪声流:条件流处理语言与当前视觉信息,将二者融合为统一的条件表征;噪声流则处理带噪声的动作序列与未来世界表征,通过Flow Matching同时学习动作去噪与未来状态去噪。未来世界表征并非生成的完整图片,而是DINO-v3对未来观测的潜在编码,用于表征物体位置、机械臂状态与空间关系等核心信息,模型仅需在潜在空间学习状态变化,无需还原视觉画面或生成中间视频帧。

为避免动作预测提前获取未来信息,DELE-w0.5设计了非对称注意力机制:训练过程中,动作token只能读取语言、当前观察与动作序列内部信息,无法访问未来状态目标;而未来世界表征token则可以读取所有相关信息,学习“执行该组动作后,环境会进入何种状态”的映射。未来世界表征的损失通过共享参数参与模型训练,帮助模型建立动作与环境变化的关联,但不会成为推理阶段的必要步骤。

进入推理阶段后,未来世界表征token被完全移除,模型仅保留语言、当前观察与动作分支,机器人无需生成未来图片或等待视频去噪,控制链路大幅缩短。值得一提的是,DELE-w0.5未使用开源机器人基础模型、VLA或视频生成模型的预训练权重进行二次封装,核心基座从底层自研,模型结构、可行动世界状态表征、具身数据配方与本体适配均围绕真机任务设计。

实测数据显示,DELE-w0.5在英伟达RTX 4090上的推理延迟中位数为87.5毫秒,推理速度优于GWP0.5、π0.5、LingBot-VLA2与HY-VLA,与Spirit-v1.5接近,但完整任务成功率显著更高。

从具身智能视角看,DELE-w0.5改变了什么?

DELE-w0.5与视频WAM的核心差异,不止是生成帧数的减少,更是模型依赖关系的根本转变:视频生成关注观察空间的连续视觉变化,而机器人控制关注物理世界的可执行结果。以“打开冰箱取出饮料”任务为例,机器人真正需要保障的是:冰箱门已打开、目标饮料已取出、物体当前持有状态正确、前置状态未被破坏,最终达成“饮料在手中且冰箱关闭”的目标,而非复现冰箱门打开过程中的每一个视觉瞬间。

因此,未来世界表征分支的价值不仅是提供额外的训练监督,更是迫使策略学习结果导向的状态转移表征:判断一个动作是否正确,不仅要看其是否符合示范动作,更要看其能否将环境推进到与任务目标一致的最终状态。

真机效果验证

未来世界表征的有效性最终需要通过真机任务检验。研发团队在Astribot S1双臂机器人上设置了四项长程任务:带把手门的开启、冰箱取可乐、向杯中加冰、将爆米花包装放入微波炉并启动加热,覆盖了接触式操作、目标提取、双手交接、工具使用、受限空间放置与最终状态确认等多种场景。

实验对比了DELE-w0.5与GWP0.5、XR0、π0.5、LingBot-VLA2、HY-VLA、Spirit-v1.5、GR00T-N1.7七种代表性策略,所有方法使用相同的任务数据进行等量微调,采用一致的任务指令、场景重置方式、180秒执行预算与成功标准。每项任务每个方法进行20次正式测试,总计640次真机实验。

为准确衡量长程执行能力,技术报告采用两项核心指标:一是完整任务成功率,即机器人满足最终物理条件才算任务成功;二是有序阶段进度,记录机器人连续完成的任务阶段,前置步骤未完成时,偶然动作不会被计入进度,避免单次成功抓取掩盖后续执行问题。

实验结果显示,DELE-w0.5在80次自身测试中完成50次,完整任务成功率达到62.5%,而表现最强的基线XR0仅完成24次,成功率30.0%,DELE-w0.5的成功率高出32.5个百分点,约为其2.1倍。在平均有序阶段进度上,DELE-w0.5达到81.3%,表现最好的基线GWP0.5为61.3%,差距达20.1个百分点。

分任务来看,DELE-w0.5的开门成功率为80%,冰箱取可乐为65%,杯中加冰为45%,微波炉爆米花任务为60%,四项任务均取得最高结果。真正的差距出现在任务后半程:多数基线能够完成前期的抓取或接触步骤,但在技能衔接处容易失败,而DELE-w0.5更频繁地抵达任务后半程,更容易将阶段性进展转化为完整成功。

以开门任务为例,DELE-w0.5的20次测试全部抵达旋转把手并推门的阶段,最终完成16次;冰箱取可乐任务中,18次成功取出目标罐,13次完成全流程,失败主要出现在双手交接与最终关门环节;杯中加冰是四项任务中最长的,19次成功拿起冰铲,14次进入抓取阶段,11次成功取得冰块,最终9次完成倾倒与场景恢复;微波炉任务中,机器人每次都能打开炉门并拿起包装,16次完成关门,12次成功启动加热。

这项62.5%的完整任务成功率是亮眼的结果,显著超过同数据同协议下的代表性基线,证明了这条技术路线的潜力。当然,距离工业级稳定部署,模型仍需进一步提升成功率,并接受更开放环境的检验。

研发团队还测试了DELE-w0.5的zero-shot跨背景能力。从杂乱的办公工位到开阔的会议室,在桌面材质、空间布局、光照与视觉背景发生显著变化的环境中,DELE-w0.5仍能顺利完成微波炉操作与杯中加冰任务,无需依赖固定场景或记忆特定背景,已经具备了初步的跨背景泛化能力。

结语

世界模型的价值最终由机器人能否完成任务来检验,画面生成的真实程度仅代表模型对视觉过程的还原能力,而动作能否围绕任务目标展开、承接前一步结果,并将环境推进到正确终态,才更贴近真实部署的需求。

对于具身智能而言,最有用的未来信息未必是一段可观看的视频,也可以是无需完整视觉复现,但足以融合真实物理空间信息、用于约束行动的世界表征。DELE-w0.5正是沿着这个方向迈出了重要一步,其意义不在于终结路线之争,而是为世界模型提供了全新思路:不再以生成视觉过程为中心,而是以机器人的行动结果为中心。未来,DELE-w0.5将为跨物体、跨场景与跨本体等任务提供新的研究方向,真机部署的实际效果将进一步检验这条技术路线的发展潜力。

以上内容不代表本平台立场,仅供读者参考