文章摘要
新一代通用大模型接入机器人控制系统后,任务表现优于同类方案,但真机测试暴露出不安全动作、损坏硬件等问题,通用模型仅解决理解问题,具身智能仍缺系统级支撑框架。相关团队推出机器人多智能体自进化框架RoboRSI,经多轮测试验证,该框架可有效提升性能、大幅压缩场景适配成本,助力具身智能落地推广。

当通用人工智能模型的能力突破到新的层级,具身智能领域迎来了前所未有的变量。过去我们以为机器人需要定制化的控制代码才能完成任务,但随着大模型的快速进化,一切都在改变。

就在新一代通用大模型发布后不久,有团队将其直接接入机器人任务执行系统,取得了远超预期的效果。在一项机器人控制测试中,该模型的任务成功率达到95%,远高于同类对比方案的40%;同时其Token消耗仅为后者的1/6.2,部署成本更是只有对比方案的1/2.3。

这样的表现让整个具身智能行业陷入讨论,不少观点认为通用大模型将直接接管该领域,具身智能可能会成为通用模型的一个子分支。有头部具身智能企业的创始人坦言,当前行业还没有真正的竞争壁垒,通用模型公司在人才、算力和资金上都拥有明显优势,未来1到2年将是行业的关键窗口。有行业研究指出,如果这一趋势持续,大语言模型最早可能在今年年底、最晚到2029年就能实现对机械臂的实时控制。

不过亮眼的单项表现并不能代表通用模型已经可以在真实环境中安全稳定地控制机器人。有官方评测团队指出,该模型在真机测试中多次发出不符合物理规则或存在安全隐患的动作,甚至造成了硬件损坏。出于安全考虑,测试团队提前终止了包含18项任务的真机评测,该模型未能完成全部测试项目。这也提醒行业,通用模型的能力突破只是起点,如何约束机器人动作、处理执行失败、保障长期稳定运行,仍是系统层面需要解决的核心问题。

通用模型能力在变强,但通用性本身也是一把双刃剑。就像智能体需要在基础模型之上构建配套的支撑框架,具身智能领域恰恰缺少一套能够积累经验、持续进化的完整系统。近期,有团队推出了面向复杂真实场景的机器人多智能体自进化框架RoboRSI,试图回答这样一个核心问题:当基础模型已经具备强大的理解和推理能力后,如何在系统层面构建起持续执行、诊断、修订和复用的完整闭环。

多智能体自进化:为具身智能打造的支撑框架

该框架的核心设计思路可以概括为:为人类和智能体分别提供适配的交互接口。对于人类使用者,框架提供高层引导能力,无需深入底层实现细节,只需要专注于目标设定、专业判断和安全边界的划定,日常的执行任务则交由多智能体系统完成。对于智能体本身,框架则提供清晰的结构化约束,通过层级化的技能树明确修改范围、成功标准和失败反馈路径,让局部的修订始终围绕全局任务目标展开。无论基础模型的能力有多强,都需要这样一套系统级的支撑框架,才能适配具身智能的真实场景需求,而RoboRSI正是针对这两个核心痛点打造的具身智能专属支撑系统。

四个智能体,构建完整执行闭环

具身智能的上下文管理远比普通对话复杂,机器人的执行过程包含大量图像、轨迹、工具调用记录和失败细节,如果全部堆在一个上下文空间中,模型很容易陷入信息膨胀和错误归因的困境。因此RoboRSI采用了多智能体协作的架构,将规划、执行、诊断和修订的工作拆分到不同的上下文空间中,通过四类智能体协同完成任务:

  • 调度智能体:作为整个系统的中枢,负责任务队列管理、并发任务调度、断点恢复和技能版本管理,将用户输入的高层目标拆解为可执行的任务序列。
  • 规划智能体:根据当前的环境观测和已有的技能库,生成具体的执行计划,核心是基于现有条件判断“当前该如何行动”。
  • 执行智能体:真正负责落地执行的角色,调用机器人的底层工具,包括感知、导航、抓取、放置等,完成动作执行并生成候选能力。
  • 审核智能体:在单次执行完成后登场,根据执行日志、过程视频和轨迹数据复盘问题、定位失败原因,并将修订建议反馈给调度智能体,推动下一轮的迭代优化。

这四类智能体围绕同一个任务和同一份执行证据接力运行,形成了“执行→诊断→修订→再执行”的完整闭环。值得注意的是,人类始终保留着对任务目标、价值判断和安全边界的控制权:在真机部署场景中,人类负责安全监管和方向调整;而在仿真环境中,系统则可以自动完成更多的复位和判定工作。这也让工程师的角色发生了根本转变,不再需要逐行编写任务代码、跟进每一次底层执行,而是转向设定目标、审核结果和提供方向性指导。

TSR技能树:让经验沉淀可复用

让机器人持续迭代进化,不仅仅是让智能体反复尝试,更重要的是将每次尝试的结果和经验沉淀下来。为此该团队提出了自顶向下技能细化机制,用四层的技能树来组织机器人的全部能力:

  • 任务族:定义总体目标与约束,比如“家庭地面清理”这类泛化的任务方向。
  • 复合技能:组合多步执行能力,比如“搜索目标→移动到目标位置→抓取→放置”这样的连贯动作序列。
  • 原子任务:边界明确、结果可验证的最小任务单元,比如“抓取地面上的黄色包装袋”这类具体的执行步骤。
  • 基础技能:直接与机器人硬件交互的底层能力,包括视觉感知、移动控制、抓取、放置等最基础的操作。

这样的技能树结构为智能体提供了结构性约束,每次修改都被限制在清晰的技能边界内,智能体可以专注于局部的实现和修订,不会因为连续调试而偏离全局的任务目标。历史经验也不再只是零散的对话记录和日志,而是可以转化为下一轮执行中真正可调用的能力。

从探索到复用:优化资源分配

在早期的探索阶段,智能体需要逐步观察环境、选择工具、执行动作,每一步都需要依赖模型的推理能力。但当某条执行路径被反复验证为稳定可靠后,继续让智能体逐步骤调用工具就会造成资源浪费。该团队设计了三阶段的演进机制:首先从成功的调用链中提取稳定的执行结构,将物体类别、目标区域和空间关系等参数化,最后将可复用的流程固化为代码技能。当类似的任务再次出现时,智能体只需要选择、监控并在必要时修订整条技能,重复的工具调用步骤则由固化的代码直接承担。

在基准测试中,启用代码固化功能的版本相比未启用的版本,任务回合通过率从21.5%提升到29.0%,中位Token消耗下降29.4%,中位视觉语言模型调用次数下降27.2%,中位执行时间下降17.0%。这意味着智能体的推理资源可以被更高效地分配,只留给真正需要判断和决策的变化部分。

实验验证:零样本适配与扰动鲁棒性

在仿真环境中,该团队进行了系统性的定量验证:

  • 零样本任务适配:在没有现成任务代码的情况下,系统从基础技能开始迭代。经过约一天的并行执行,LIBERO基准上的累计任务通过率从32/120提升到95/120;RoboTwin基准上的通过率从初始的9/50提升至36/50。与仅使用执行智能体的基线方案相比,完整的多智能体配置在RoboTwin上将任务通过率提升了4倍。
  • 代码固化效果:在LIBERO的120个任务、5组初始布局、共600个测试回合的实验中,启用代码固化功能的版本相比未启用版本,各项指标都有明显提升,包括通过率、Token消耗、模型调用次数和执行时间。
  • 扰动鲁棒性:在覆盖视觉纹理、相机视角、语言指令、光照条件、物体布局、机器人初始状态、传感器噪声七个维度的840个扰动实例测试中,RoboRSI通过自适应修订将任务通过率从31.1%提升至47.4%,额外恢复了137个原本会失败的测试实例。

解锁全场景的商业潜力

回到真实的应用场景,以家庭地面清理这类任务为例,2024年完成一个类似的演示Demo,需要两名工程师连续投入约一个月的时间,编写2000到3000行的任务代码。而在RoboRSI的框架下,同样级别的能力构建只需要一天就能完成完整的迭代闭环。

这意味着在优秀的基础模型之上,配合运行良好的系统框架,新场景的适配成本可以被大幅压缩。RoboRSI让系统能够自主完成任务拆解、技能实现、执行诊断和代码修订的闭环,适配新场景的核心成本从“工程师驻场数周”转变为“设定目标+系统自主迭代+人工审核和安全把关”。

这种变化为高度个性化的场景打开了新的商业空间。每个家庭的户型、家具布局和物品摆放都各不相同,如果每次部署都需要工程师驻场数周,服务成本将很难支撑大规模推广。而基于RoboRSI这类智能体系统,机器人可以在通用能力的基础上,通过现场反馈自主迭代,逐步学会适配特定家庭的清理路径和操作技能。当家具移动、物品更换时,也可以沿用同一套机制完成适配,减少重新开发的工作量。类似的需求也存在于布局各异的门店、办公室和小型仓储空间,缩短适配周期意味着过去因定制成本过高而难以覆盖的分散场景,都有机会成为可服务的市场。当然,一次实验中的“一天迭代”并不等于任意场景都能实现一天部署,但能够率先将新场景的适配周期和人力成本大幅压缩,其商业价值无疑是不可估量的。

尾声:在基础模型之上

随着新一代通用大模型的出现,具身智能行业正在面临新的选择。行业内有一种共识:仅在语义基座上做微调改造得到的具身模型,很容易遭遇通用大模型的降维冲击。通用大模型的能力告诉我们,当模型的通用能力足够强时,许多看似需要专门设计的功能会通过涌现能力自然出现。但基础模型解决了“理解”的问题,从理解到持续稳定地执行,中间还有一层系统级的能力需要构建,这也正是具身智能企业不可替代的核心价值:

  • 经验的结构化管理与复用:通用大模型可以理解单个任务,但无法管理该任务在多轮执行中积累的经验。
  • 行为边界与安全约束:机器人在物理世界中操作,错误的代价远高于软件场景,因此需要一套行为约束框架,让智能体的自进化在可控范围内发生。
  • 部署后的持续迭代能力:真实世界的场景永远在变化,新物体、新布局、新的失败模式会不断出现,能够在部署之后持续从真实执行中学习、积累和改进的系统,才是长期竞争力的来源。

而RoboRSI证明,一套设计得当的自进化框架,可以让机器人在部署之后持续沉淀经验、持续进化。当模型层的能力和系统层的自进化框架最终融合,具身智能有望进入一个全新的阶段:机器人不仅能完成人类教给它的任务,还能从每一次真实执行中发现人类尚未构建的解决方案。

对于具身智能企业来说,下一阶段的机会在于将不断增长的模型能力,转化为用户在真实世界中用得起来、用得长久的机器人能力。未来该团队还将探索RoboRSI和新发布的世界动作模型的协同方案,进一步突破机器人的能力边界,推动技术走向真实应用。

强大的基础模型已经到来,具身智能行业需要改变与破局的关键节点也已迫在眉睫。欢迎来到通用人工智能的时代。

该框架的相关技术资料可通过以下渠道获取:

  • 技术博客:https://lab.noematrix.ai/blog/2-roborsi/
  • GitHub:https://github.com/nssmd/RoboRSI
以上内容不代表本平台立场,仅供读者参考