千寻智能Moz1/Moz2:具身智能从工业到商服的跨越

在近期的人工智能大会上,机器人领域的进展再次成为全场焦点,不少展台前都围满了驻足观看的观众。不少参展的机器人都展示了跳舞、搭积木、分拣物品等亮眼的单动作技能,观众们纷纷举起手机,追逐着那些动作流畅、充满趣味性的演示。
某具身智能企业的展台则带来了两款风格截然不同的机器人:通体黑灰、造型沉稳的Moz1正专注地完成任务,而首次公开亮相的Moz2则有着奶杏色的机身,搭配粉色小围脖,正忙着向观众挥手打招呼,凭借可爱的造型吸引了大量目光。
展台搭建了一个还原日常的客厅场景,沙发、餐桌、冰箱和洗碗机错落摆放,桌上的可乐、餐盘,沙发旁的玩偶散落各处,和普通家庭的客厅几乎没有区别。当工作人员说出「帮我整理一下客厅」的指令后便退到一旁,Moz1随即开始自主工作:它先对整个场景进行感知,随后走到餐桌旁拿起可乐放进冰箱,又将餐桌上的脏碗送入洗碗机完成清理。
就在准备去沙发区域整理玩偶时,一个意外掉落的纸团出现在桌面上。Moz1立刻停下原本的动作,重新感知环境变化,调整了任务顺序,转而捡起纸团扔进垃圾桶。处理完这个临时插入的任务后,它没有从头开始整理,而是继续完成未完成的玩偶收纳工作,将沙发附近的玩偶放进了收纳筐。
整个过程中没有工作人员在一旁提醒下一步该做什么,也没有补充额外的操作指令。从理解自然语言指令、拆解任务流程,到应对突发的环境变化、调整行动方案,再到接续完成剩余任务,Moz1连续完成了多项子任务。现场的屏幕还同步展示了任务拆解、当前步骤和后续计划,让观众清晰看到一句简单的指令如何被转化为连贯的动作序列。
整理客厅为何比看上去更具挑战
看似简单的客厅整理,对机器人来说其实远比想象中复杂。当人类听到「整理客厅」的指令时,会自动补全很多未明说的细节:哪些物品属于需要收纳的范畴、应该放到什么位置、先整理桌面还是先清理地面——这些都依赖长期积累的生活常识和经验,而机器人并不天生具备这样的认知能力。
这类任务和抓取、分拣等边界清晰的演示完全不同:后者通常预先定义了任务起点、结束条件、物品位置和操作流程,就像标准化的生产工位;但真实的客厅并非固定的作业空间,家具布局、物品摆放随时可能变化,目标物体可能被遮挡,甚至会出现训练中从未见过的新物品,加上人员走动和临时放置的杂物,环境始终处于动态变化中。这种开放、无固定规则的场景,正是典型的非结构化环境。
因此,整理客厅考验的并非只是机器人能否完成抓取、移动和放置的单个动作,而是能否理解模糊的自然语言目标,将其转化为可执行的完整任务链:识别物品、判断类别、确定归位位置、规划行动路径、完成操作,并在每一步后验证结果。当场景发生变化时,它还需要重新评估当前状态,调整任务顺序和行动方案,而不是依赖预先设定的坐标、路线或脚本。
这背后需要两项紧密关联的核心能力:长程任务执行能力和场景泛化能力。前者要求机器人能够沿着较长的任务链持续推进,牢记整体目标、已完成的步骤和待处理的事项;后者则要求机器人在布局变化、遇到陌生物品、出现遮挡或路径受阻时,依然能够将已掌握的技能迁移到当前场景中。
早期的具身智能演示往往更擅长完成拿起杯子、打开抽屉这类单点任务,但当任务链变长、子任务之间产生依赖时,问题就不再只是能否完成单个动作,还包括是否记得任务的初衷,以及完成当前步骤后下一步该做什么。很多机器人会出现遗忘目标、遗漏步骤、重复处理已完成物品的情况,甚至会因为一次局部失败就偏离后续计划,这类任务上下文和状态丢失的问题,常被形象地称为「金鱼记忆」。
长程任务还会放大局部的执行误差:假设每个子步骤的成功率为95%,且各步骤近似独立,那么包含10个连续步骤的任务,一次性全部成功的概率仅约60%。动作链越长,识别偏差、抓取失败和放置误差越容易累积;环境越开放,机器人需要处理的异常状态和分支情况也就越多。
因此,评价具身智能的长程能力,不能只看单个动作是否精准;测试泛化能力,也不能只看机器人能否在另一套布置中复现相同的流程。更关键的是,它能否主动发现失败或环境变化,判断问题出在哪一步,并通过局部修正或重新规划,继续完成最初的总体目标。
开冰箱、抓取餐具,或是把玩偶放进收纳筐,这些单个动作其实并不新鲜。此次展示的突破在于,机器人需要围绕「整理客厅」这一整体目标,自主识别当前场景状态、决定下一步行动,并在环境变化中持续执行任务,而不是依赖人工逐步提示或预设的固定脚本。
任务也从桌面上的单次抓取,扩展到跨越不同家具和功能区域的连续操作,也就是从物体级的操作走向空间级的协同。机器人不仅需要处理更多的动作,还要协调导航和操作:比如从桌边拿起饮料后移动到冰箱前,即使原本的桌面已经离开视野,它依然需要清楚自己正在处理什么物品、是否抓稳了物体、冰箱门的状态如何,以及还有哪些物品尚未归位。
这就要求机器人持续维护一份动态更新的任务状态和场景表征,包括整体目标、已完成和待完成的子任务、物品的空间关系、环境变化、执行异常情况,以及下一步的行动方案。只有同时保持任务上下文,并动态理解非结构化的环境,机器人才能从完成一次演示,进阶到在不同场景中完成同类任务。
长程任务背后的技术突破
要实现这样的长程任务能力,单纯把多个机器人动作按顺序连接起来是远远不够的。如果饮料永远放在同一个位置、冰箱门始终保持固定角度、路径上没有任何障碍,固定程序当然可以让机器人依次完成抓取、移动和放置,但真实环境并不会严格配合预设的脚本。
物体可能被移动、目标位置可能被遮挡、某一步可能没有真正完成,机器人抓住的物品也可能在途中滑落。固定脚本只知道下一条指令是什么,却不会判断当前环境是否满足执行指令的条件,更不会在必要时暂时放弃原计划、重新安排任务顺序。
针对这些问题,该企业推出的Spirit v1.6采用了VLA与世界模型一体化的架构。VLA负责将用户提出的语言目标、机器人感知到的环境信息,以及机器人能够执行的动作连接起来;世界模型则用于理解物体之间的关系,并预判执行某个动作后环境可能发生的变化。
进一步来看,Spirit v1.6在预训练阶段引入了对抽象动作Token的预测。这里的动作Token可以理解为对连续机器人行为的高层抽象表示,相比直接在冗长的底层动作序列中逐步推演,抽象动作Token能够降低长序列训练和推理的计算成本,同时加强环境感知、动作决策和执行调整之间的联动。
以将饮料放进冰箱为例,机器人不能只生成一段机械臂的运动轨迹。它需要判断饮料的位置和朝向,找到合适的抓取点,确认通往冰箱的路线和冰箱门的状态,在动作执行后还要重新观察:饮料是否抓稳、冰箱门是否真正打开、放置结果是否符合预期。
从系统能力来看,这涉及长程任务中的执行监控环节:抓取动作结束,并不代表饮料一定被成功抓住;机械臂进入冰箱,也不代表饮料已经稳定放置。系统需要根据执行后的视觉和状态反馈,对子任务完成情况进行判定,再决定是继续执行原计划、重试当前步骤还是调整整体方案。
世界模型提供的是对环境状态和动作后果的内部估计,帮助机器人预判「如果这样做,接下来会发生什么」,但它并不直接等同于长期记忆。长程任务执行还需要持续维护初始目标、已完成的任务、环境变化和当前计划。VLA与世界模型一体化的意义,在于让状态预测、动作生成和执行反馈形成完整闭环,而不是从头到尾播放一套固定的动作序列。
除了客厅整理的演示外,该企业还通过其他多个任务展示了这套系统的多维度能力:桌面整理任务重点测试动态重规划能力,当物品被临时移走、目标位置被遮挡,或是已经整理好的桌面再次被打乱时,机器人需要重新判断执行顺序,而不是沿用失效的计划;药片分拣任务则考验了小尺寸物体识别、毫米级定位和末端力控能力;扭蛋机互动演示则面对机器随机转动圈数和观众伸手位置变化的情况,要求机器人根据视觉反馈实时调整动作轨迹。这些任务都指向同一套核心能力:理解目标、感知变化、规划动作,并根据真实执行结果持续调整判断。
从展台到落地:跨越稳定性与数据关
判断一套具身智能系统是否成熟,不能只看它在展台上能否完成一次任务,更要看它能否在真实场景中长期、重复、稳定地工作。这也是该企业优先选择进入工业场景的原因:工业环境的任务目标相对明确,但对精度、节拍、一致性和安全性的要求更高。柔性线束、来料偏差等不确定因素,以及高压接插件插接等复杂非标工序,都会持续考验机器人的泛化和纠错能力。
据该企业披露,Moz1已经在动力电池PACK产线承担高压测试插头插接等复杂非标工序,作业成功率稳定在99%以上。目前,该企业已经与京东、博世、舍弗勒等企业展开合作,持续拓展零售和工业场景的应用。
对该企业而言,工业落地不仅提供了商业化验证的机会,也带来了关键的真实运行数据。机器人在实际作业中出现的抓空、滑落、停滞和接触点判断错误等情况,都可以被记录、清洗和复盘,再用于模型迭代,这也是其数据金字塔体系的出发点。
在数据金字塔的底层,不同来源的数据承担着不同的作用:互联网视频用于建立通用的视觉和语义认知,可穿戴设备记录人类在真实空间中的操作过程,遥操作数据帮助模型适配机器人本体,真机运行数据则进一步记录任务中的成功、失败、修正和恢复过程。在中间层,采集到的数据需要经过清洗、标注、质检和复盘,才能真正转化为训练模型的有效材料。该企业自研的轻量化可穿戴采集设备已经迭代至第七代,并计划在2026年沉淀百万小时级的真实世界交互数据。在最上层,这些数据最终要转化为机器人对陌生物体、陌生环境和陌生任务的泛化能力。
由此形成了一套持续迭代的闭环:真实场景暴露问题,运行过程沉淀数据,数据推动模型升级,升级后的模型再进入更多场景接受检验。机器人最终需要在摩擦、遮挡、形变和执行误差中接受考验,这也是现实运行数据难以被实验室数据完全替代的原因。
此次展会上首次公开亮相的Moz2,则代表了该企业的技术路线向下一个场景的延伸。Moz2是面向商超、酒店、办公楼宇等商用服务场景推出的探索性产品,用于验证公共空间中的机器人形态、人机交互方式和硬件适配能力。
与侧重工业操作能力的Moz1相比,Moz2的设计更具亲和感:机身采用柔性材质和圆角处理,降低了机械设备在公共空间中的距离感;全身配置32个自由度,使用全向舵轮底盘和折叠腿部结构,能够适应商场、酒店和办公场所中的灵活移动需求;7自由度仿生手臂与三指灵巧手,则为后续的物品递送、商品理货等操作预留了硬件空间。
现阶段,Moz2主要用于商服场景中的人机交互形态打磨、用户体验验证和硬件适配测试,暂未搭载完整的任务功能。未来,Moz1在工业场景中已经验证的长程规划、精细操作和动态适配等能力,将逐步迁移至Moz2。这也标志着该企业「先工业、再商服、后家庭」的技术路线向前推进了一步:先在价值明确、要求严格的工业环境中打磨技术和稳定性,再进入开放程度更高、人机交互更频繁的商用服务空间,最后才是复杂度最高、需求最分散的家庭环境。
结语
机器人进入日常生活,正在从一种想象变成可以被具体观察的现实。诚然,真实的客厅依然比展台上的演示场景复杂得多:沙发缝里可能卡着遥控器,桌上可能放着不知该扔还是该留的票据,地上还躺着一只不肯配合的拖鞋。人类的指令也常常临时变化,说完「都收起来」,又补一句「那个别动」。机器人最终要面对的,就是这样一个不讲固定规则、随时会变化的真实世界。
可以看到,行业的关注点已经不再局限于单个动作的展示,而是转向更长的任务过程。从单步操作到空间级的连续任务,「整理客厅」这样的长程任务,正在成为具身智能能力发展的自然延伸。
技术变革的早期现场,往往并不总是最震撼的。1903年,莱特兄弟第一次完成动力飞行时,飞机只飞行了十几秒、几十米;但从那一刻起,人类进入天空的路径已经被彻底打开。今天的具身智能也正处在类似的阶段:展台上的机器人依然在打磨细节,但当它开始围绕一个完整目标自主执行任务,并在干扰中持续推进时,真正的变化已经发生。
展台上的Moz1还在不断完善细节,但当那句「整理客厅」的指令下达后,人类已经可以退到一旁。这或许正是具身智能改变生活的起点。

