文章摘要
机器人技术团队开源新一代具身基础模型DM0.5,延续VLA架构并完成多方面技术升级。它在多项测试中表现优异,有零样本泛化、微调适配等能力。文章还介绍其训练与推理优化方案,以及在Docker环境本地部署和不同模型推理的指南。

近期,机器人技术团队正式开源新一代原生具身基础模型DM0.5。作为今年2月推出的初代具身大模型DM0的升级版本,DM0.5延续了视觉语言架构(VLA)技术路线,以40亿参数视觉语言模型作为多模态核心主干,搭配680M参数的动作专家模块生成连续机器人动作,围绕开放指令理解、长程任务执行、动态干扰应对以及多机器人本体适配等核心方向完成了系统性技术升级。

在真机基准测试RoboChallenge Table30 v2中,DM0.5拿下了当前最优性能,综合得分达到54.42;在主流仿真基准LIBERO、RoboTwin 2.0上,模型平均成功率分别达到99.0%与93.5%。本次开源共包含三款模型:通用预训练基座是面向开放世界机器人控制的通用VLA基座,可用于下游任务的微调与推理;针对LIBERO仿真操作任务微调的模型,以及适配RoboTwin 2.0双臂仿真场景的模型,这两款微调模型可直接用于对应任务的推理与评测,也可作为其他场景任务适配的初始化模型。

从初代DM0到DM0.5:走出实验室的开放世界适配

今年2月发布的初代DM0,是团队首个从零搭建的具身基础模型,能够完成可控环境下的一系列复杂动作任务学习,初步验证了VLA范式在高质量数据、有效优化与可靠评测下的可行性。但真实世界对机器人的要求远高于实验室Demo:机器人需要真正理解任务指令的深层含义,能够在不同相机视角、物体状态、环境条件、机器人本体以及各类干扰下稳定执行任务,并通过少量数据微调快速适配新的真实任务。这正是DM0.5的开发出发点——让具身机器人模型真正走出实验室,适配真实开放世界场景。

技术架构三大核心升级

DM0.5延续VLA架构,在技术层面完成了三个方向的关键创新:

  • 历史信息融合模块:传统具身模型仅依赖当前帧画面决策,DM0.5引入历史帧信息融合机制,同时接收当前观测帧与过往关键帧,为决策提供长达1分钟的任务进程状态信息,既降低对固定历史窗口的依赖,也能在历史数据缺失时退化为单帧观测决策,保证场景适应性。
  • 广泛具身推理训练:团队在机器人训练数据中引入11种自回归任务,让模型训练不再仅依赖连续动作监督,同时强化指令遵循、动作预测与时序环境感知能力。将机器人数据从单一动作监督扩展为“指令理解、时序推理和动作生成”的联合监督任务,有效提升复杂长程任务中的指令遵循度、动作连贯性与任务完成率。
  • 动态动作匹配层:真实机器人数据采集节奏往往不统一,若强行绑定固定时间点,模型易学习采集节奏而非任务规律。DM0.5通过动态规划算法,将预测动作与真实轨迹进行单调递增匹配,兼顾相邻动作轨迹连续性,允许执行速度差异同时避免跳过关键步骤,让模型更聚焦抓取、放置等核心操作,生成的动作序列更平滑鲁棒。

训练与推理优化方案

DM0.5采用多源数据对齐后的混合训练策略:机器人操作数据构成动作学习核心主体,视觉语言数据维持视觉主干的开放词表理解与空间推理能力,导航数据提供长指令理解与路径决策监督,视频理解数据进一步增强时序建模、事件理解与动态场景表征能力。

优化阶段采用分组学习率设置:视觉语言主干使用较小学习率,降低灾难性遗忘风险以保留通用视觉语言能力;动作专家使用更大学习率,充分学习机器人动作分布规律。训练过程采用混合精度与分布式架构,并针对动作专家独立优化,支撑长上下文、多相机输入与历史token带来的额外计算开销。

DM0.5推理以Action Chunk为单位执行,默认使用10个diffusion/Flow Matching steps生成包含50步动作的chunk。经过优化后,DM0.5在RTX 4090单卡上推理速度可达10Hz,在H100单卡上则能达到20Hz。

核心优势:面向真实场景的硬实力

1. 零样本泛化能力

对比测试结果显示,DM0.5在绝大多数评测维度上均显著优于同类竞品与初代DM0模型,展现出更强的指令理解与任务执行能力。

2. 微调适配能力

真机桌面操作测试:使用RoboChallenge Table30 v2评测真实机器人桌面操作能力,该测试覆盖长期记忆、多步顺序执行、视觉感知与目标定位、精细抓放、工具交互以及双手协同等多种真实桌面场景,采用通用设置训练单一模型以全面检验VLA模型的真实环境泛化能力。测试结果显示,DM0.5整体成功率达到43%,综合得分54.42。在盖章定位、按按钮等需要记忆目标状态与动作顺序的任务中,DM0.5的记忆能力显著提升执行稳定性,能够更好保持中间状态、目标位置与多步操作顺序,减少遗忘、重复执行或顺序错误。同时依托视觉-语言-动作联合预训练,DM0.5在复杂精细操作上表现出色,比如双手托盘等双臂协同任务中,能够稳定控制相对位姿与运输过程;插花等需要物体识别、抓取姿态选择与精细放置的任务中,展现出较强的视觉定位与末端控制能力。

仿真场景测试:在LIBERO单臂操作环境与RoboTwin2.0双臂操作环境这两个主流仿真基准中,微调后的DM0.5均展现出强大的任务适应能力,性能达到当前最先进水平。

导航场景测试:使用R2R与RxR两个基准评测导航性能,模型在大多数评测指标上拿下最优成绩。在R2R Val-Unseen数据集上,其导航误差与成功率均达到最高;在更具挑战性的RxR Val-Unseen数据集上,DM0.5导航版本在所有四项指标上均位居第一,相比所有基线方法取得显著优势。

3. 历史记忆能力

历史记忆能力用于衡量模型能否将过往观测整合为当前决策的上下文。团队构建了两个真实场景实验:“拿起杯子擦桌子”任务验证模型能够利用近期历史追踪物体状态与任务进度;“模仿人类示范放电池”任务验证模型能够保留早期示范信息,并将其约束到后续机器人动作执行中。

4. 策略鲁棒性

  • 相机视角变化:实验数据显示,尽管第三视角相机位置发生变化,整体任务成功率仅出现轻微波动,未出现系统性显著下降,表明模型在不同视角条件下具备较强鲁棒性。
  • 人为干扰测试:在自研测试机型上,DM0.5在人为移动目标以及短时遮挡的情况下,仍能保持对当前场景的理解并持续推进任务流程。当容器位置和朝向发生变化后,模型没有依赖原始固定轨迹,而是根据新的视觉状态重新调整机械臂末端位置与动作方向,继续完成目标物体操作。

本地部署指南

DM0.5推荐使用Docker环境部署,避免宿主机上CUDA、PyTorch、flash-attn等依赖版本不匹配问题。系统要求为Ubuntu 20.04/22.04搭配NVIDIA GPU,推荐显卡型号为RTX 4090、A100、H100或H20;训练建议使用8卡配置,推理阶段仅需单卡即可完成。

模型下载(以DM05主基座为例)

modelscope download --model Dexmal/DM05 --local_dir ./checkpoints/DM05

Docker环境启动

git clone https://github.com/dexmal/opendm.git
cd opendm

docker run -it --rm --gpus all --network host
–name opendm
–shm-size=16g
-v “$PWD”:/app/opendm
-w /app/opendm
dexmal/opendm:latest /bin/bash

conda activate opendm
pip install -e .

启动推理服务(DM05主基座)

script/dm05_launcher.sh \
  --task inference --nproc_per_node 1 \
  --model-config.model-name-or-path ./checkpoints/DM05 \
  --model-config.chunk-size 50 \
  --inference-config.port 7891

服务启动后,/process_frame 接口接受multipart/form-data格式的请求,包含任务指令text、当前机器人状态数组states以及各路RGB相机图像,返回下一步Action Chunk。可使用如下命令快速验证:

bash tests/curl_demo.sh http://SERVER_IP:7891/process_frame

LIBERO / RoboTwin 2.0微调模型推理

分别指定对应的实验配置、chunk-size、动作维度与相机键:

# LIBERO(单臂,动作7维,2路相机)
script/dm05_launcher.sh \
  --exp playground/dm05_libero.py \
  --task inference --nproc_per_node 1 \
  --model-config.model-name-or-path ./checkpoints/DM05-libero-bf16 \
  --model-config.chunk-size 10 \
  --inference-config.output-action-dim 7 \
  --inference-config.image-keys images_1 images_2 \
  --inference-config.port 7891

RoboTwin 2.0(双臂,动作14维,3路相机)

script/dm05_launcher.sh
–exp playground/dm05_robotwin2.py
–task inference --nproc_per_node 1
–model-config.model-name-or-path ./checkpoints/DM05-robotwin2-bf16
–model-config.chunk-size 50
–inference-config.output-action-dim 14
–inference-config.image-keys images_1 images_2 images_3
–inference-config.port 7891

完整的训练、评测流程和benchmark客户端配置可参考对应代码仓库的文档。

以上内容不代表本平台立场,仅供读者参考