文章摘要
千寻智能在2026世界机器人大会让Moz1机器人复刻“整理客厅”任务,虽看似重复,实则多维度升级,成功率显著提升。其快速进化源于“时间密度”概念,即系统进化整体速度。这背后是全栈技术能力升级,涵盖数据管线、后训练机制、Agent决策层等。目前系统能力已外溢到工业和公共服务场景,“时间密度”成衡量具身智能企业发展的重要标尺。

在行业展会的机器人展台中,最吸引观众的往往是新奇亮眼的动作展示:跳舞、握手或是演示前所未见的复杂任务,直观且充满新鲜感的表现总能让观众驻足记录。但当机器人真正落地工厂、商场或是普通家庭时,现实的考验就回归到最实在的层面:能否更快、更稳地完成任务,同时尽可能减少人工介入辅助。

正因如此,千寻智能在2026世界机器人大会上的展示显得格外特别——他们没有推出全新的演示场景,而是让Moz1机器人复刻了一个多月前在另一场行业展会中展示过的“整理客厅”任务。不少观众第一反应会觉得这是“炒冷饭”,但实际体验后会发现,这套看似重复的演示背后藏着不小的进步。

我们在展馆中向工作人员询问了这个疑问,对方笑着解释,虽然间隔不到30天,但这套Demo已经完成了多维度的升级:可乐放入冰箱的自主推理成功率从约80%提升到99%以上,碗放入洗碗机的成功率也从约90%跃升至99%以上,导航目标确认的耗时更是降低了近50%。除此之外,在颜色、种类、位置都存在变化的泛化场景中,捡垃圾任务的执行成功率也达到了85%。这些优化并非集中在单个抓取动作或是固定工位操作,而是覆盖了“整理客厅”这套长程复合任务的全流程环节。

两次展示同一款Demo,本质上是这套具身智能系统的两张进化快照。表面上看,机器人完成的还是同样的任务,但水面之下,是数据、训练、Agent、导航、硬件和基础设施共同构成的全栈技术能力的全面升级。那短短30天内的快速进化,究竟是如何实现的?这就要从一个由千寻智能首次在具身智能领域提出的学术概念——“时间密度”说起。

所谓时间密度,指的是一套系统能够在多短的时间内完成问题吸收、训练验证,并将改进成果部署到真机上,它衡量的不是单次演示的峰值表现,而是系统进化的整体速度。

其实在展会初期,这套系统的成功率就已经不算低了,可乐进冰箱接近80%,碗进洗碗机接近90%。但长程任务的90%和固定工位上的90%难度完全不在一个量级:单步任务失败只是这一个动作没做好,但长程任务中,一个微小的偏差就会改变后续的环境状态,错误还会沿着任务链条不断向后扩散。

整理客厅这样的生活场景任务,本身就包含了一连串复杂的环节。当用户发出指令后,系统需要先明确一系列核心问题:

房间里有什么?哪些东西需要整理?应该先做什么后做什么?机器人应该走到哪里才能完成操作?如果中途失败,下一步应该怎么办?

具体来说,机器人需要听懂模糊的指令,先环视环境判断需要归位的物品,记住未完成的步骤,再跨空间移动、抓取物品、开门、放置、关门,全程还要不断确认操作是否正确。在这个过程中,物体姿态变化、机器人站位偏移、背景干扰甚至开门角度不足,都可能让后续动作失去节奏。因此,Demo跑出高成功率只是故事的开始,并不意味着这个任务已经做到万无一失。

在本届大会的展会现场,冰箱操作、洗碗机收纳、捡垃圾、玩偶收纳四组任务,分别暴露了长程任务中的不同难题:连续操作能否稳定衔接,站位和物体状态变化后是否还能完成任务,环境改变后能否准确识别目标。而且展会现场本身就是一个不断增加难度的测试场:观众穿行、物体遮挡、物品位置变动都会临时打乱导航路线,机器人需要持续避障、重新接近目标,再将导航和后续操作衔接起来。这些看似麻烦的现场环境,反而成为了具身机器人的绝佳压力测试场景。

这种现场表现的稳定性,绝非依靠单一模型调参就能实现。只有当每一次失败都能被系统识别、回传、复现、训练并重新部署,形成完整的数据闭环,才能支撑起30天内的快速迭代。

首先来看作为系统进化“燃料”的数据管线。

想要让机器人在30天后变得更出色,首先要解决的问题是“这次失败的原因是什么?下一次训练应该调整哪些参数?”比如一次抓垃圾失败,真正关键的不是任务终止,而是系统能否定位失败的根源:是没有识别到垃圾,还是抓取位置不对,或是动作规划出现了偏差。答案就藏在数据中。

千寻智能的数据平台汇集了Web视频、第一视角数据、uDAS数据、遥操作数据以及真机任务数据,覆盖了数据清洗、标注、质检、训练任务管理、模型评测和结果追踪全流程。目前,千寻自研的第七代数据采集设备,已经将数据采集成本降至传统遥操作方式的1/10,数据可用性从30%提升至95%,配合全国超过30万个采集点位,为系统进化提供了源源不断的“燃料”。

不过对于具身智能来说,真正有价值的数据并非最“干净”的标准化数据,这就要提到千寻智能独创的“脏数据”训练理念和数据金字塔体系。现实世界中,灯光会变化、物品不会永远固定在原位、行人会突然经过、环境也会不断变动,如果机器人的训练场景永远是规整标准的,那么在真实环境中就容易被无关信息干扰。因此,千寻智能选择将真实世界的杂乱变化直接作为模型泛化训练的一部分,让模型适应真实场景的不确定性。

除了数据管线,后训练机制与底座模型,是决定机器人动作上限的核心基石。后训练阶段需要解决的核心问题,是让模型真正理解经验,学会判断“什么信息值得关注”。

以“把碗放进洗碗机”为例,这个任务背后至少包含十个连续的操作阶段:任务开始时,全局视觉会帮助机器人快速判断自身位置和洗碗机的方位;进入实际操作阶段后,关注范围会不断缩小,此时碗的位置、洗碗机把手的位置、沥水架的位置才是关键信息。通过后训练,团队让模型能够对墙面、灯光等无关变化保持稳定,同时对碗的位置、机器人站位等影响动作的关键变化保持高度敏感。

数据和后训练最终都要落到模型能力上,支撑这一切的正是Spirit v1.6基座模型。该模型采用了VLA与世界模型深度一体化的融合架构,不同于传统机器人“感知-规划-控制”分步执行的模式,Spirit v1.6将视觉感知、语言理解、动作生成与世界状态预测纳入统一训练,实现了边感知、边决策、边调整,就像经验丰富的老司机开车,遇到突发状况可以手脚下意识联动。在由UC伯克利、斯坦福、英伟达联合发起的RoboArena国际评测中,Spirit v1.6曾登顶全球榜首,超越英伟达DreamZero等模型,成为首个登上该榜单的中国具身智能模型。

在Agent决策层,核心目标是防止机器人在长程任务中出现“金鱼记忆”——也就是干着干着就忘记当前任务目标。

比如一次抓垃圾失败后,如果动作模块给出停止信号,而规划器误判为任务完成,直接进入放垃圾环节,这种单步误判就会沿着任务链条不断向后扩散。为了阻断这种连锁错误,Agent就像一位拿着备忘录的工头,需要持续管理任务状态:不仅要保存“整理客厅”的总目标和已完成进度,还要根据现场实时状态决定下一步是继续执行、重试、跳过还是重新规划。比如抓垃圾失败后,是再试一次还是更换目标?有人挡住路线时,是等待还是绕行?只有Agent始终保持任务状态对齐,才能避免机器人中途“断片”。

在早期展会现场就有一次意外考验:相关参观团队到访时,原本静态的客厅演示区瞬间变成了高动态、多遮挡的复杂环境,Agent全程紧盯任务进度,导航受阻时判断是等待还是绕行,有人靠近操作区就暂停并确认安全后再恢复,目标被遮挡时就重新进行感知,最终机器人在人潮中完成了穿梭避障和连续操作,任务没有中断。

导航与操作的协同,则体现了“到达”标准的升级。

早期调试时,机器人虽然能够顺利走到洗碗机前,但有时会停得太靠近冰箱,从导航指标来看已经“到达”,但实际操作时,这个站位无法顺利打开洗碗机,只能额外进行大幅度的位姿补偿。因此团队重新定义了“到达”的标准:机器人不能仅以抵达某个坐标点为完成标准,而是要到达后续动作能够顺利展开的“可操作位姿”。除了站位精准,导航的启动速度也得到了优化:通过模型、算法和工程链路的协同调整,从接收任务到生成首个导航目标的耗时中位数降低了近50%。

以上都是软件层面的优化,别忘了还有硬件与基础设施。

在展会初期,团队曾遇到伺服电机异常、电源故障、接口松动等问题,往往是前面十几分钟的演示顺利完成,最后一个接口松动就让整条任务功亏一篑,这种情况在长程任务中对团队来说打击巨大。因此展会结束后,硬件团队调整了策略,将“哪里坏了修哪里”的被动维修模式,改为“设计质量前置”的主动防控模式,尽可能在图纸阶段就拦截问题,同时持续改进伺服、电源模块,将设计评审和装配核查固化为标准化流程。

此外,模型生成的最终动作需要依靠Moz1本体执行,这款机器人拥有26个自由度,搭载了自研一体化力控关节;而新模型能否快速部署到真机上,则取决于设备管理、推理部署、日志回传等底层平台能力。这些看不见的基础设施,进一步缩短了训练和真机之间的距离,让现场出现的问题案例能够更快进入下一轮迭代。

凭借现有的模型能力,千寻智能在本届大会的全新场景中实现了零样本迁移,冰箱操作、玩偶收纳、碗具和可乐抓取、洗碗机处理等多项核心任务的实地测试成功率达到100%,展现出强大的跨场景泛化能力。但当成功率达到100%后,团队反而开始主动“找茬”:调整起始位置、改变物体姿态、更换背景环境等。因为他们发现,单一场景下的100%成功率,并不代表系统的稳定边界已经足够宽广。

真机调试中暴露的细节问题,更能体现长程任务的复杂性。比如之前提到的单步误判沿任务链条扩散的情况,就需要系统在每一步都确认操作是否真正完成,否则一个小失误就会引发连锁错误。展会现场的网络状况也带来了不少挑战:现场缺乏稳定的有线网络,云端推理还会出现不可预测的长尾延迟。为此团队进行了针对性优化:删减冗余的判断逻辑,将部分视觉判定任务改为并行执行,同时尽可能让推理计算与机器人的其他动作同步进行,以此缓解网络延迟带来的影响。

展馆中涌入大量观众时,原本静态的场景会变成高动态、多遮挡的空间,行人经过会让目标短暂消失,规划好的路线也可能临时失效,此时导航不仅需要持续避障、重新接近目标,还要和Agent、VLA保持任务状态对齐。从这个角度来看,展会现场本身就是现成的压力测试场,恰恰能够侧面证明全栈技术打磨的扎实程度,而这种极端环境下的测试,也是工业场景稳定落地的绝佳预演——尽管场景不同,但本质都是检验机器人离开实验室后,能否长时间稳定运行。

目前,千寻智能的这套系统能力已经开始从展会Demo向真实工业场景外溢。Moz1机器人已经进入头部动力电池企业的PACK产线,承担高压测试插头插接等非标工序,作业成功率稳定在99%以上,单日工作量可达熟练工人的3倍;同时团队还与多家行业头部企业展开了场景合作。另一款Moz2机器人则尝试将同构基座模型下的能力迁移到商超、酒旅、办公楼宇等公共服务场景,并在本届大会现场首次展示了自然语音交互功能,支持招手、比心、握手等拟人化互动。

回过头来看,就能理解千寻智能为什么选择在两个展会中复刻同一款Demo。具身智能的早期阶段,大家最关注的是“能不能完成任务”;而当越来越多的机器人能够展示出基础动作后,下一阶段的核心问题已经发生了变化:同样的任务能不能连续完成?环境改变后还能不能完成?中途失败时系统能否定位错误?出现的问题能否进入下一轮训练,让下一次表现更少出错?

总结来说,具身智能的终极目标从来不是造出一台无所不能的机器人,而是跑通一套能够自我生长的技术系统。而我们之前提到的“时间密度”,最终衡量的也不只是一段时间内任务成功率提升了多少,而是一套技术体系处理真实失败的速度:谁能更快地吸收问题、完成迭代并将改进部署到真机上,谁就能更快地拓展技术边界。这一点,正在成为衡量具身智能企业长期发展势能的重要标尺。

以上内容不代表本平台立场,仅供读者参考