文章摘要
国内初创企业德塔智能推出对标海外头部产品Figure Helix的双足人形机器人基础模型Delta 0,该模型适配市面通用量产硬件,可全自主完成全套家务等多步骤长程任务,其双层架构等技术性能领先,相关技术获机器人顶会最佳论文。该公司成立半年获近5亿元融资,未来瞄准高危场景落地,定位全栈物理AI基础模型提供商。

近期国内人形机器人领域迎来新突破,初创企业德塔智能正式推出双足人形机器人基础模型Delta 0,直接对标头部产品Figure Helix,在速度、长程任务等维度均不落下风,任务覆盖场景甚至更为丰富。

公开演示中,搭载Delta 0的量产通用人形机器人仅用3分钟就自主完成了全套家居清洁与整理工作:从平整床品、捡拾玩偶,到收纳脏衣、处理厨余垃圾,全程行云流水,没有出现任何卡顿或失误。

值得注意的是,这款机器人的硬件本体并非定制机型,而是市面上可直接采购的通用量产产品,因此所有动作的实现难度都集中在Delta 0这套基础模型上。

以拉开洗碗机柜门为例,团队实测柜门需要约5公斤的拉力才能打开,但通用机器人的单臂最大拉力仅约1.5公斤。Delta 0并没有依赖单纯的手臂发力,而是通过全身借力完成动作:一只手撑住柜体作为支撑支点,另一只手握紧门把手,同时腰部和腿部向后施加力量,借助全身重量将柜门顺利打开,完美解决了硬件力量不足的问题。类似的细节还包括脚踏式垃圾桶的操作,需要精准控制单脚力度,既要弹开桶盖又要保持身体平衡,避免失衡摔倒。

Delta 0采用双层架构设计:大脑负责感知环境、接收指令并规划整体动作序列,小脑则负责将抽象指令转化为全身69个关节的协同动作——其中身体关节29个,双手各占20个关节。不同于传统拆分上下半身的控制方案,这套模型将全身纳入统一动作空间进行训练,让机器人在手臂力量不足时,可以主动调动腰腿部的力量辅助完成动作,实现全身资源的最优调度。

为了精准控制接触力,团队提出了“内生力”计算方案:通过目标位置与实际受阻位置的差距直接计算需要施加的力量大小。基于这套思路开发的纯算法力位混合控制技术,还拿下了机器人领域顶会CoRL的最佳论文奖项。

除了力量控制,动作流畅度也是Delta 0的核心优势。在整理床品时,面对柔软易变形的被子,机器人可以一边沿床边移动调整站位,一边快速整理被面;播放黑胶唱片时,从捏取唱片、掀开防尘盖到放置转盘的动作一气呵成。这得益于模型从预训练阶段就使用未经过降速处理的人类全身动作数据,后续的具体任务训练则通过遥操作采集:操作员直接以自身身体作为遥控器,动作细节会完整转化为机器人的训练数据,让机器人可以复刻人类的麻利操作习惯。

Delta 0的大脑每秒刷新10到20次动作规划,提前预判后续的动作序列,实现边执行边思考,不会出现执行完一步就停顿发呆的情况;小脑的控制频率最低为50次每秒,团队内部已经实现500次每秒的版本,动作顺滑度极高,甚至需要用0.5倍速播放才能看清细节。

连贯完成多步骤长程任务的关键在于动作衔接的合理性。比如端着杯子走到洗碗机前,需要先将杯子放在台面上再拉柜门,否则既无法拉开门也无法在开门后够到杯子。如果单步动作成功率为95%,那么30步连续动作的总成功率仅约20%。

Delta 0通过隐式世界-动作模型解决这个问题:在实际动作执行前,模型会先在内部预演整个任务序列,而不需要生成可视化画面。模型内部分为三路并行处理当前感知、未来预测和动作规划,实现各模块之间的实时互通。对于任务间的过渡环节,模型可以自主补全逻辑,不需要人工额外标注。面对突发状况时,模型也能自主纠错:比如没抓稳玩偶就重新抓取,被按回的垃圾桶盖会用更大力度再次踩开,全程不需要人工介入干预,甚至在不同灯光环境下也能稳定完成任务。

为了进一步提升任务成功率,团队采用了人在回路的学习方案:将大小脑之间的通信指令改为增量动作,每次仅调整当前姿势的微小偏移。当机器人快出错时,人工可以实时纠正动作,这段纠正后的轨迹会直接成为新的训练数据。配合价值模型评估任务进展,优先学习进展正向的动作,最终洗碗机放杯子的任务成功率从仅20%提升到65%,团队目标是实现接近完美的任务成功率。

团队还对Delta 0的小脑控制器进行了零样本对比测试,将其与四款公开的全身控制器(包括英伟达开源的SONIC)进行对比,使用501段共约3.5小时的日常动作数据,全部未经过针对性训练。测试结果显示,Delta 0的全局位置误差仅0.106米,身体各部位位置误差为16.73毫米,两项指标均为五款控制器中最优。

为了支撑模型训练的海量数据需求,团队自研了头戴式全身全景数据采集设备D1,可以完整记录人类工作时的第一视角画面和全身骨骼细节,包括手指的精细动作。按照计划,团队将在年底前累计采集超过10万小时的高质量人类动作数据。

核心团队与融资情况

Delta 0由德塔智能推出,这家成立于2026年1月的初创公司由北京通用人工智能研究院孵化,核心团队背景亮眼:创始人兼CEO马晓健毕业于清华计算机系,后在UCLA获得计算机科学博士学位,曾在Google DeepMind、英伟达研究院从事机器人学习研究,回国后主导通研院具身基础模型相关项目;联合创始人兼首席科学家黄思远是清华自动化系本科、UCLA统计学博士,曾在DeepMind和Meta开展前沿研究,现任通研院具身机器人中心主任,前文提到的力位混合控制技术就出自他提出的理论框架;联合创始人刘航欣拥有弗吉尼亚理工大学本科学位,UCLA机械工程硕士和计算机科学博士,现任北大智能学院助理教授,曾牵头多个工业人形机器人落地项目,还主导研发了全手视触觉灵巧手F-TAC,相关论文发表于《Science Robotics》《Nature Machine Intelligence》等顶刊。

成立仅半年,德塔智能就完成了六轮融资,最新一轮天使++轮融资近5亿元,战略投资方包括乐聚、智元、星海图等多家机器人本体厂商。

落地场景与愿景

在创始人马晓健看来,能源、基建等高危场景将在未来1-2年迎来人形机器人的集中落地。马斯克曾提出让Optimus先登上火星,因为火星环境恶劣,载人任务风险极高,人形机器人可以自主完成环境适应和作业任务;而地球上的高压电站、井下巷道、海上平台等场景同样具备类似的高危特性——环境复杂有台阶和障碍物,设备开关完全适配人类身高和手型,这类场景非常适合人形机器人替代人类作业。据公开信息,今年国家电网计划采购500台人形带电作业机器人。

德塔智能的定位是全栈式的物理AI基础模型提供商,团队认为当前大模型擅长数字世界的符号推理,但通往通用人工智能(AGI)还缺少物理世界的交互拼图。一套可以理解物理规则、适配不同机器人硬件的大脑,配合具备接触感知和借力能力的小脑,实现两者的深度协同,正是德塔智能想要补齐的关键一环。

以上内容不代表本平台立场,仅供读者参考