文章摘要
当前物理机器人与移动Agent开发已发生范式转变,不再单纯追求更大模型参数,转而搭建可靠系统层(即Harness)推动大模型落地。本文梳理五套前沿代表性方案,总结出三条核心解题思路与七条实现路线,指出行业重心将转向系统层优化,助力物理Agent实现可靠落地。

机器人Agent系统层优化全解析:从模型能力到落地可靠性

2026年的物理机器人与移动Agent开发已经迎来了范式转变:不再单纯追求更大的模型参数,而是转向构建可靠的系统层来让大模型真正落地到真实交互场景。近期涌现的五套前沿方案,共同探索了如何弥合“模型单项能力强”与“系统落地可靠性差”之间的鸿沟。

核心项目概览

下表整理了五套代表性方案的基本定位与公开信息:

项目名称核心定位公开信息
X-OmniClaw边缘原生多模态移动Agent,实现手机端的感知-记忆-行动闭环arXiv:2605.05765,开源基于Kotlin/Python
MemoHarness让Agent控制层从执行经验中学习,支持测试时逐用例自适应arXiv:2607.14159,开源Python代码
HumanCLAW具身智能评估框架,通过解耦决策与执行衡量动作智能arXiv:2607.27180,未开源
RoboClaw长程机器人任务框架,用VLM贯穿数据采集-训练-执行全周期arXiv:2603.11558,开源基于LeRobot
RPent用LLM编排冻结VLA,将其转化为可靠的操控基元arXiv:2607.08448,开源Python代码

这些项目有一个共同的核心判断:模型只需要负责局部的专长能力,而全局的编排、调度、验证则需要专门的系统层来完成,也就是所谓的“Harness”。

核心矛盾与挑战拆解

当我们尝试让大模型在真实环境中完成长程任务时,往往会遇到四层递进的挑战:

  • 职责边界模糊:无法清晰划分决策与执行的责任,失败后无法定位具体问题环节,比如机器人摔倒到底是决策错误还是运动控制失误。
  • 信息记忆分散:决策所需的本体感知、历史状态、环境信息分散在不同模块,无法高效整合,长上下文推理还会出现退化。
  • 反馈验证薄弱:测试阶段几乎没有实时反馈,现有基准只能给出二元的成功/失败标签,无法提供具体的失败归因信息,真实部署中连这种标签都难以获取。
  • 数据进化困难:训练数据与真实部署的分布不匹配,人工采集和复位的成本极高,难以形成闭环的自主进化。

每个项目都针对这些挑战的不同侧面给出了解决方案:

  • X-OmniClaw需要解决移动设备输入异构的问题,如何融合截图、摄像头、语音等不同信号形成统一的执行意图
  • MemoHarness面临控制层高维耦合的问题,六个维度的配置互相牵连,且缺乏足够的监督信号
  • HumanCLAW的核心难点是决策与执行的纠缠,无法单独测量模型的纯动作智能
  • RoboClaw需要解决三阶段的语义断裂,数据采集、训练、部署的逻辑不一致导致错误级联
  • RPent则面对范式错配的问题,端到端VLA擅长局部操作但容易在扰动下出错,而LLM擅长推理却无法生成精细的接触动作

通用解决方案的三条核心主线

五套项目的解法背后,可以归纳为三条贯穿性的解题思路:

1. 分层与解耦:拆分决策与执行

几乎所有项目都采用了“慢脑决策+快脑执行”的双层架构:慢脑负责全局规划、任务拆分和动作选择,由LLM或VLM承担,不参与底层的控制;快脑负责将决策转化为连续的关节动作、UI点击或命令执行,由VLA策略、运动生成器或确定性控制器完成。这种拆分的核心目的是实现失败归因的确定性,比如HumanCLAW通过半物理模拟将平衡和电机跟踪的失败剥离,让所有失败都可以归因于决策环节;RPent则通过解析式基元将非接触操作从VLA中剥离,让抓取失败可以直接定位到VLA模块。

慢脑(决策层,100ms+):全局观察 → 任务拆解 → 选择动作/基元/工具 → 编排顺序
└─ 由LLM/VLM承担,冻结或即插即用,不参与底层控制
▼
快脑(执行层,20ms级):将决策转化为连续关节动作/UI点击/命令执行
└─ 由VLA策略/运动生成器/确定性控制器/工具函数承担
▼
物理/系统(结果层):施加真实后果,返回新观测

2. 基元化:连接离散推理与连续动作

大模型只能输出离散的文本token,而物理动作是连续的空间控制,两者之间存在天然的鸿沟。各个项目通过将连续动作折叠为离散可组合的基元来解决这个问题:

  • HumanCLAW:定义了8个原子技能,包括行走、转向、坐下等
  • RPent:提供8个标准化基元,包括移动到目标、旋转手腕等
  • X-OmniClaw:集成了50+原子工具,包括设备操作、系统调度、文件处理等

基元化的优势非常明显:可以强制将组合推理推回给决策者,每个基元都可以独立验证、训练和扩展,同时失败的归因也可以精确到具体的基元环节。

3. 经验外置与自进化:从单次执行到持续学习

传统的Agent系统通常是一次配置永久生效,执行的日志只是静态的数据。而新的方案则将每次执行转化为可检索的决策经验,跨案例蒸馏为全局模式,实现测试时的自适应调整:

  • MemoHarness构建了双层经验银行,将每个用例的经验和全局模式分开存储,实现检索式的自适应
  • RoboClaw通过纠缠动作对(EAP)实现物理世界的自复位,正向执行完成后自动逆向复位,形成“练习-复位-练习”的闭环
  • RPent则通过任务特定的轨迹和全局规则实现经验外置,重绑定坐标而非重放,保证跨场景的迁移性

这三条思路共同填补了模型能力与系统可靠性之间的鸿沟,让Agent从“能做单项任务”转向“能可靠完成长程任务”。

五套项目的详细对比

我们可以从两个维度对这些项目进行分类:

按模型是否冻结的阵营划分

这是最清晰的分类标准:

  • 阵营A:决策者冻结,纯编排:HumanCLAW、RPent和部分场景下的RoboClaw都属于这个阵营,模型不进行任何训练,只负责编排和决策,比如HumanCLAW的9个VLM全部冻结,零微调来衡量推理的泛化能力。
  • 阵营B:将Harness作为学习对象:只有MemoHarness属于这个阵营,它将控制层的六个维度作为学习目标,在开发集上进行结构化搜索,优化出最佳的配置。
  • 阵营C:纯工程组装:X-OmniClaw属于这个类别,没有模型训练,依靠多模型编排、提示工程和行为克隆实现智能。

这个分类背后的权衡逻辑非常明确:模型越强,Harness可以越简单;模型越弱或越不可靠,Harness就需要越聪明。

按优化目标的视角划分

  • 建造者视角:X-OmniClaw和RoboClaw,目标是让系统真正完成任务,用成功率、干预率和数据效率来衡量
  • 考官视角:HumanCLAW,不构建可部署系统,而是设计可隔离变量的评估框架,衡量纯动作智能
  • 教练视角:MemoHarness和RPent,优化如何更好地使用现有模型,分别针对控制层和编排策略

所有这些项目都认同一个核心观点:模型能力与系统可靠性之间的鸿沟,必须通过系统层来填平,而不是单纯提升模型本身的能力。

业界的七条成熟实现路线

从2026年的前沿研究来看,物理Agent的构建已经形成了七条清晰的实现路线:

  1. 分层编排:“慢脑+快脑”的双层架构已经成为行业标准,差异仅在于决策者是否冻结和执行层是否需要训练。
  2. 基元化接口:将连续动作折叠为离散基元,成为连接大模型与物理/UI交互的主流介质。
  3. 记忆外置化:将状态和经验从LLM的上下文窗口中移出,构建可查询、可演化的持久存储层。
  4. 验证与过程监督:从“跑完看结果”转向“每步看状态”,通过实时验证避免错误级联。
  5. 自主数据引擎:从人工采集转向系统自主采集数据,通过自复位循环降低人工成本。
  6. Harness优化自动化:将手工调整prompt和参数的隐性工程,转化为可搜索、可归因的系统层优化。
  7. 评估基准解耦化:设计可隔离变量、失败可归因的评估框架,让评估更有信息量。

这七条路线共同构成了新一代物理Agent的完整拼图,实现从单体模型承担一切到分层系统各司其职的转变。

未来发展趋势判断

结合当前的研究进展和批评意见,我们可以按确信度排序给出七条趋势:

  1. 高确信:从训练模型到用好模型:行业重心已经从“堆模型参数”转向“构建可靠的使用系统”,这一趋势的确定性最高,因为模型能力的提升不会自动填平落地的鸿沟。
  2. 高确信:Harness优化走向自动化与严谨评估:MemoHarness已经示范了搜索+诊断+经验检索的方案,但需要解决预算匹配的问题,未来会出现更聪明的搜索算法和更严格的评估标准。
  3. 高确信:执行层从开环走向闭环:当前的很多方案都存在开环chunk的问题,无法适应需要连续视觉判断的任务,未来会发展出可中断的闭环执行架构。
  4. 中高确信:具身自我意识成为核心主题:HumanCLAW的实验显示,模型的最大瓶颈不是识别目标,而是不知道自己的身体状态,未来会有更多研究关注本体感知、身体模型和接触信号的整合。
  5. 中确信:评估基准走向统一与严谨:当前的基准大多高估了Agent的真实能力,未来会要求“到达即自省”,而不仅仅是物理上到达目标,同时会更加注重预算匹配和泛化能力的评估。
  6. 中确信:在线学习与跨Agent经验共享:从离线训练转向在线持续学习,实现Agent的越用越强,同时解决经验质量保障和灾难性遗忘的问题。
  7. 低-中确信:多模态传感融合与真实世界验证:当前的方案大多依赖RGB-D感知,无法处理透明、反光、软体等复杂场景,未来会整合温度、触觉、力传感器等多模态信息,同时需要验证仿真训练的策略能否迁移到真实机器人上。

同时需要注意两股反向的力量:一是保守派的批评,认为Harness优化的增益可能部分来自额外的搜索尝试而非真正的策略提升;二是平台方的收编风险,如果系统级Agent能力被大厂收编,第三方Agent的生存空间可能会受到挤压。

双视角解读核心命题

我们可以用两种语言来解读前面的核心命题:

1. 为什么“模型很强,系统却不可靠”?

通俗解释:想象你有一个特别聪明的朋友,数学和记忆力都很好,但让他去厨房把苹果放到盘子里,他可能会走到半路忘记任务,或者撞到桌子打翻杯子。不是他笨,而是他没有“身体的感觉”——他能看到世界,但不知道自己的手在哪里、离目标有多远,也感受不到自己的动作是否正确。就像一个坐在轮椅上的司机,能看懂导航却控制不了车辆,聪明的大脑和听话的身体之间缺一根连线。

专业解释:这是能力与可靠性的错位问题,可以归结为三层纠缠:一是职责纠缠,系统失败由决策、执行误差和平衡失败共同导致,无法反卷积出具体责任主体;二是信息纠缠,决策所需的本体感知、接触信号和历史状态要么不存在,要么被塞进容易退化的长上下文;三是信号纠缠,现有基准只能给出二元奖励,无法提供失败的归因信息,真实部署中连这种奖励都难以获取。

2. 解耦、基元化与经验外置为什么有效?

通俗解释:我们可以用三招解决这个问题:第一招是分工,让聪明的朋友只负责思考,让一个专业的机器人替身负责执行,这样失败就能明确归因;第二招是把动作变成“命令卡”,只允许发布简单明确的指令,每个指令都能被精确执行;第三招是记笔记,每次执行后记录经验,下次遇到类似情况时先参考笔记。这三招组合起来,就能让系统从“偶尔成功”转向“可靠完成任务”。

专业解释:这三种方法分别解决了结构性缺陷:解耦解决了归因不可能的问题,通过剥离平衡、电机跟踪等低级控制,让失败可以明确归因于决策环节;基元化解决了文本与连续动作的鸿沟,将高维连续控制折叠为离散基元,让大模型可以进行离散选择;经验外置解决了无反馈部署的问题,将执行日志转化为可检索的经验,实现测试时的自适应调整。

3. 未来的发展方向是什么?

通俗解释:未来的机器人会朝着四个方向发展:一是像“教练+运动员”的组合,聪明的教练负责全局规划,专业的运动员负责具体执行;二是命令卡越来越精细,从简单的走、转、停发展到抓取、切割、搅拌等复杂动作;三是机器人逐渐学会“感知自己的身体”,就像闭着眼睛也能知道手的位置;四是机器人会记笔记并互相学习,今天的失败教训会成为明天的经验,不同机器人之间可以共享知识。

专业解释:未来的趋势可以归结为三个结构性转向:一是优化对象的迁移,从模型权重转向系统控制层;二是反馈通道的丰富化,从稀疏二元奖励转向维度级诊断、实时介入和本体感知;三是评估的严谨化,注重预算匹配、泛化能力和主观确认式的成功定义。三个关键拐点值得关注:当VLM具备可靠的身体状态估计时,HumanCLAW的基准成绩会大幅提升;当Harness优化在匹配预算下证明独立价值时,相关研究的地位会得到确认;当平台方收编系统级Agent能力时,第三方生态的走向会发生重大变化。

总结与展望

五套前沿项目共同指向一个核心结论:物理机器人Agent的下一轮增长,不在于更强的模型,而在于更好的系统。

X-OmniClaw证明了这套思路在移动端的可行性,MemoHarness将系统层优化上升为方法论,HumanCLAW揭示了具身自我意识的核心短板,RoboClaw打通了全生命周期的数据闭环,RPent则展示了如何通过编排让冻结的VLA变得可靠。每个项目的缺点,恰恰就是未来的改进方向:

  • HumanCLAW需要增加本体感知通道,解决“自我意识缺失”的问题
  • RPent需要实现闭环执行,解决开环chunk的局限
  • RoboClaw需要推广EAP到不可逆操作,突破可逆性的限制
  • MemoHarness需要解决预算匹配的问题,证明优化的独立价值
  • X-OmniClaw需要完善标准化评估和权限治理体系

这些改进方向,正是下一代机器人Agent系统层的完整施工图,将推动物理交互智能从实验室走向真实的生产和生活场景。

五套项目逐一详解

1. X-OmniClaw:边缘原生多模态Android Agent

这套方案由OPPO Mente Lab推出,将手机作为第一人称交互接口,围绕感知-记忆-行动的闭环设计。它解决了云端方案无法获取真实设备上下文、纯视觉方案缺乏结构化精度的问题,支持多模态输入融合、跨App任务执行、个性化记忆和行为克隆。

它采用Kotlin和Python的混合架构,Kotlin负责平台适配和工具执行,Python负责Agent的业务逻辑,通过桥接模式实现两者的交互,兼顾了移动端的性能和开发的灵活性。

核心优势:系统完整性强,是当前移动端Agent中最成熟的开源方案;采用务实的工程路线,行为克隆和双轨UI理解都经得起生产考验;具备工业级的可观测性,支持完整的日志和调试信息;采用隐私优先的设计,大部分感知和操作在本地完成;支持Agent自省,可以修改自身的运行时状态。

主要局限:受限于Android系统的碎片化,不同厂商的无障碍服务支持不一致;活跃会话的功耗较高,难以长期后台运行;LLM的延迟和成本是部署的核心障碍,部分功能仍需云端支持;缺乏标准化的基准测试,第三方难以复现结果;状态管理较为分散,审计和调试存在一定难度。

改进方向:建立标准化的评估基准,完善对抗性UI测试框架,强化隐私技术栈,统一状态管理体系,构建权限治理框架。

2. MemoHarness:让Agent的控制层从经验中进化

这套方案的核心洞察是:Agent的性能瓶颈往往不在于基础模型,而在于包围模型的控制层,也就是所谓的Harness。传统的Harness是静态的、全局统一的,而MemoHarness将其变为可学习、可记忆、可逐用例自适应的系统。

它分为两个阶段:训练阶段在有参考答案的开发集上进行六维结构化搜索、诊断和经验蒸馏;测试阶段对每个新用例检索经验银行,实现零标签、零反馈的自适应调整。

核心优势:首次将Agent的控制层进行完整的六维分解,为后续研究提供了清晰的分类框架;通过检索式自适应实现高效的经验复用,无需每个用例都重新搜索;在多个基础模型上都取得了显著的性能提升,证明了方案的通用性;采用正确性优先的设计,避免搜索漂移到错误的配置;开源代码质量高,易于扩展和二次开发。

主要局限:搜索成本未纳入基准比较,被批评高估了优化收益;泛化能力有限,在持出集上的提升不明显;主要实验仅使用单一基线模型,缺乏更多模型的验证;未对每个维度的独立贡献进行消融分析;经验质量无法保证,偶发的成功可能被蒸馏为错误模式;测试时的检索和自适应会增加调用延迟。

改进方向:实现匹配预算的基准比较,建立经验质量门控机制,支持在线学习和增量搜索,进行归因消融分析,探索无监督搜索场景,构建多租户的经验隔离体系。

3. HumanCLAW:解耦决策与执行,衡量动作智能

这套方案由多所高校联合推出,核心目标是回答“VLM能否通过物理身体行动”的问题。它通过解耦决策与执行,将平衡、电机跟踪等低级控制从闭环中剥离,让所有失败都可以归因于决策环节。

它构建了包含41个室内场景、1218个长程任务的基准测试集,测试了9个前沿VLM,最佳成功率仅为16.8%。核心发现是:识别目标不是瓶颈,模型的“具身自我意识”缺失才是关键,也就是模型不知道自己的身体位置、是否到达目标或是否撞到障碍。

核心优势:通过决策与执行的解耦,首次实现了动作智能的独立测量和失败归因;采用自动化的确定性根因分类器,无需人工标注即可分析失败模式;通过实验得出了具身自我意识缺失的关键结论,为后续研究指明了方向;工程设计优雅,原子技能+ControlNet的架构易于扩展和维护;为多个模型提供了公平的对比基准,发现了开源模型接近前沿的重要结论;为具身智能的改进提供了具体的方向。

主要局限:采用半物理抽象,牺牲了真实世界中的平衡和电机耦合挑战;交互词汇表单一,仅支持坐下等有限的动作;缺乏本体感知接口,无法区分“缺失输入”和“缺失能力”;未与强化学习训练的策略进行对照,核心哲学假设未经检验;样本量和场景数量有限,缺乏置信区间;归因粒度仅局限于技能层面,无法分析技能内的参数错误;技能扩展依赖人工策展,成本随规模上升;运动先验与场景存在错位,无法适应复杂的环境约束。

改进方向:丰富交互词汇表,增加本体感知通道,与强化学习策略进行对照,构建持续记忆与自定位模块,实现动态技能参数化,将方案迁移到真实人形机器人,通过RL改进身体意识,开发难度自适应的验证器。

4. RoboClaw:VLM贯穿全生命周期的长程任务框架

这套方案解决的核心问题是三阶段语义断裂:数据采集、模型训练和部署执行的逻辑不一致,导致错误级联。它通过统一语义回路,用同一个VLM Agent贯穿三个阶段,保证决策逻辑、成功判据和状态表示的一致性。

它的核心创新是纠缠动作对(EAP),为每个策略配置正向和逆向策略,正向执行完成后自动逆向复位,形成“练习-复位-练习”的闭环,将人工干预降低到原来的1/8。同时支持运行时的过程监督和三级恢复机制,避免长任务的错误级联。

核心优势:统一语义回路保证了采集、训练和部署的逻辑一致性;EAP自复位将人工干预降低到1/8,提升了数据采集效率;运行时的过程监督和三级恢复机制有效避免了错误级联;采用慢脑+快脑的分离架构,保证了硬件安全;支持部署数据回流训练,实现越用越强的闭环;支持零代码的本体接入,快速适配不同机器人;集成了LeRobot生态,易于扩展和适配不同策略。

主要局限:EAP的前提假设较强,仅适用于可逆操作;逆向策略存在一定的失败率,可能导致环境进入未知状态;VLM的云API延迟较高,影响实时性;未量化策略间的状态漂移;开源实现与论文存在一定差距,部分功能尚未完整实现;缺乏sim-to-real的迁移工具,实验成本较高;实验场景有限,仅覆盖了少数抓取类任务;存在安全性隐忧,缺乏硬件级的安全约束。

改进方向:将EAP推广到不可逆操作,优化延迟问题,建模策略间的依赖关系,扩展机器人能力,强化仿真管线,增加架构级安全约束,进行经济性分析。

5. RPent:用LLM编排冻结VLA,构建可靠操控基元

这套方案的核心诊断是:端到端VLA在标准测试中成功率很高,但在环境扰动下会大幅下降,因为它被要求同时完成语言理解、语义绑定、空间推理、长程组合和局部控制,而实际上只擅长最后一项。它通过将前四项交给LLM,让VLA只负责局部接触操作,解决了这个范式错配的问题。

它通过冻结的基元库连接LLM和VLA,包括一个基于学习的VLA_ACT原语和7个确定性解析基元,处理非接触操作。系统通过文件介导的REPL协议进行通信,支持审计和离线调试。

核心优势:通过职责再分配,将VLA的职责限定为接触操作,LLM负责其他环节,大幅提升了成功率并实现了清晰的失败归因;冻结VLA和固定基元库保证了部署的可靠性,无需更新模型权重;文件介导的REPL协议让每一步的输入输出都有完整记录,易于审计和调试;证明了LLM可以仅通过RGB-D图像自行推理空间位置,无需依赖特权状态;记忆“重绑定不重放”的设计保证了跨布局的迁移性;工程实现扎实,细节处理到位;在多个基准测试中取得了显著的性能提升。

主要局限:采用开环chunk结构,LLM在VLA执行期间完全盲视,无法实时介入;感知隔离存在脆弱性,容易受到深度噪声和选点错误的影响;基元库固定且较小,难以适应复杂的真实场景;每个新任务都需要seed 0的探索,构建记忆的成本较高;仅在模拟器中验证,未覆盖真实世界的噪声和延迟;无法胜任需要连续视觉判断的实时任务。

改进方向:实现闭环集成,与Agentic-VLA结合实现在线适应,自动化Global Memory的写入,扩展感知泛化能力,进行真实世界的验证,动态扩展基元库。

以上内容不代表本平台立场,仅供读者参考