清华等开源RPent:大模型驱动的具身智能基础设施

近年来,从Codex到Claude Code,数字世界的智能体已经展现出了全新的工作模式:通过大模型理解目标、拆解任务、调用工具并根据反馈调整计划,最终完成工作。随着GPT-6 Astra开始在真实机器人操作中进行测试,这种“以大模型作为决策大脑”的智能体范式正在向物理世界延伸。这也让一个曾经遥远的问题变得愈发具体:通用大模型能否成为机器人的“大脑”,让机器人真正完成现实世界中的复杂任务?
不同于可以随时回滚的数字代码,物理环境始终处于动态变化中,状态无法被完全观测,一旦执行动作就很难撤销,像抓取、装配、插拔这类精细操作,还需要专门的模型与控制能力。因此,物理世界的智能体不仅要“想明白”,还要做到“看得见、做得到、反应快,并且记得住”。
RPent正式开源:面向物理世界的具身智能基础设施
近日,由清华大学、无问芯穹、正行创新联合发起的具身智能体基础设施RPent正式开源。该项目由大规模具身强化学习框架RLinf的核心团队打造,延续了团队在具身智能基础设施领域的技术积累。
RPent面向真实物理世界,将通用大模型的任务理解与规划能力、VLA等专家模型的精细操作能力,以及记忆、工具和机器人接口连接起来,形成从感知、决策、执行到反馈纠错的完整闭环。这套系统能够让智能体持续适应环境变化,将经过验证的经验沉淀为可复用的能力,在与物理环境的持续交互中不断学习和进化。在LIBERO-PRO基准测试中,RPent达到了92.6%的任务成功率,并将端到端任务完成速度优化7倍以上。项目开源代码链接为https://github.com/RLinf/RPent。
演示案例:从固定动作到动态适配
在公开的演示场景中,RPent展示了多个开放式任务:机器人可以将钢珠倒入碗中,通过双臂协同擦拭盘子,还能主动移开遮挡物,找到藏在碗下的勺子。值得注意的是,这些任务并非为每种场景单独训练专用策略,机器人的核心变化在于从“执行学过的动作”,转向“理解任务、调用能力,并根据环境变化调整行动”。
比如当任务变为“将干净餐具放入纸箱”时,面对同一只蓝色盘子,纯VLA模型只会沿用训练时的固定动作,错误地将盘子放入金属篮中;而在RPent系统中,智能体会先观察当前环境,再根据新的目标选择合适的放置位置。如果执行过程中视觉定位出现偏差,它还会主动检查结果、排除错误目标,并重新定位手中的盘子,真正做到任务变化时行动随之调整。
另一个任务中,机器人需要读取瓶身和包装袋上的品牌标签,将不同饮料放入对应的袋子。抓起瓶子后,它会先进行小幅试抬来确认夹持是否稳定;当原有运动路径不可行时,会调整腕部姿态继续执行任务。面对被碗遮挡的勺子,机器人也不会直接尝试抓取,而是先移开两个碗,让目标重新变得可见且可达。这里展示的不再是预先写死的动作序列,而是一个完整的“观察-判断-执行-纠错”闭环。
最后两个任务则进一步展示了RPent对已有能力的复用:机器人可以将原本用于“拿起并放置容器”的技能重新组合,完成倾倒钢珠的任务;又可以将抓取动作与双臂协同、持续接触结合起来,完成持盘、擦拭和收纳的流程。在探索阶段成功完成任务后,RPent会将经过验证的任务逻辑沉淀为任务卡(Task Card);当再次执行同类任务时,RPent可以启用Flash Mode,直接通过任务卡复用这套流程,仅根据当前的视觉状态做必要调整,避免每一步都重新调用大模型,有效降低了具身智能体的执行延时。
整套Demo想要展示的并非“机器人又学会了几个动作”,而是一个更关键的问题:当机器人走向开放世界,新的任务、物体和障碍不断出现时,它能否像人一样将已有技能重新组织起来,完成训练分布之外的任务?RPent所探索的,正是这样的具身智能体形态——机器人不再只是执行一条固定指令,而是能够理解目标、调用能力、应对变化,并将一次成功的经验沉淀为下一次可以复用的能力,这正是具身智能体的雏形。
技术路线对比:打破单一框架的局限
当前具身智能的发展逐渐呈现出两种不同的技术路线。一条是纯VLA端到端路线,即用一个视觉-语言-动作模型直接接收观测数据、输出动作指令。这类方案在精细操作上表现不错,但一旦任务变长、语言指令变复杂、场景出现扰动,性能就会迅速退化。另一条是纯大模型Agent路线,比如CAP-X这类工作,随着GPT-6这类通用模型对具身任务的覆盖率快速提升,大模型直接输出动作已经可以完成不少任务,但它在亚厘米级的操作精度、执行时延以及“越用越强”的能力上,仍存在明显短板。
这两条路线并非简单的替代关系,而是对应了不同层次的能力。RPent并没有在两条路线之间折中,也没有试图让某一个模型包办从任务理解到机械臂控制的全部工作,而是将具身智能拆解为不同层次的能力,让不同模型各自承担最擅长的工作:
- 通用大模型负责理解任务、制定计划;
- VLA、WAM等专家模型负责高精度动作执行;
- 记忆系统沉淀经验,推动智能体持续优化;
- 框架负责连接模型、工具与真实环境,形成闭环。
由此,整套系统形成“观察-规划-执行-反馈-再规划”的闭环,让智能体从一次性执行任务,转向在真实世界中持续成长。RPent背后的算法,源于团队在7月份提出的Harness VLA工作,相关论文链接为https://arxiv.org/abs/2607.08448。
模块化架构:开放可扩展的四层设计
RPent采用开放的模块化设计,将系统划分为用户层、智能层、接口层和环境层四大层级。
用户层:智能体交互入口
用户层提供类似Claude Code/Codex的交互式命令行界面,同时还支持可选的Web Dashboard。用户可以通过该层下达任务指令,并实时查看智能体的推理过程、视觉输入和动作轨迹,实现对智能决策过程的可观测和实时交互。
智能层:任务规划与能力调度中心
智能层由Agentic Planner和Action Primitive组成。Agentic Planner结合基础模型、记忆系统和工具库,实现任务理解、规划与工具调用,并通过Agentic Loop完成“规划→执行→反馈→记忆更新”的持续优化。Action Primitive则将VLA、WAM等学习型操作模型,以及Code as Policy等程序化技能统一封装为标准工具,让大模型负责复杂任务的理解与规划,专家模型负责高精度动作执行,从而兼顾泛化能力与操作精度。
接口层:统一连接模型与机器人
接口层负责将智能体的决策转换为机器人可执行的指令,为不同设备提供统一的调用接口,包括动作执行、状态读取、环境渲染和设备复位等能力。无论是真实机器人还是仿真平台,上层的智能体、提示词和工具都无需针对设备重新开发,实现跨机器人、跨环境的迁移。
环境层:连接真实与仿真世界
环境层负责任务执行,目前已经支持LIBERO-PRO、RoboCasa、RoboTwin等仿真环境,以及Franka、双臂Franka、YAM等真实设备。新增机器人只需作为独立模块接入robots/目录,即可被框架自动识别和调用。此外,智能层与环境层采用独立进程架构,支持模型服务、机器人控制和仿真环境的独立部署、迁移与重启,为持续研发和长期运行提供工程保障。
通过模块化架构与统一接口设计,RPent不会绑定单一模型或机器人,而是构建了一个开放、可扩展的具身智能基础设施,让不同模型、技能与硬件能够灵活组合、高效协同。同时,每一次任务执行产生的反馈都可以沉淀到记忆系统,为后续任务提供经验支持,使智能体在真实环境中持续学习与优化,将智能体的能力从“一次性部署”推向“持续演进”。
解耦物理执行:分层接口体系
在数字世界中,智能体的能力边界很大程度上取决于它能调用哪些工具。MCP的出现,让大模型可以通过统一的工具协议访问搜索、代码、数据库等数字资源。但进入物理世界之后,问题变得复杂得多:机器人、相机、传感器、仿真器和各种物理设备都有各自的接口,即使是完成同一个任务,不同机器人也可能使用完全不同的控制方式。如果每接入一种设备都需要重新开发一套智能体,那么智能体很难真正实现规模化扩展。
因此,RPent将“工具-机器人-环境”进一步抽象,通过分层接口把智能决策与物理执行解耦,将“大模型决策”与“物理设备执行”连接起来,实现智能体、工具和硬件之间的统一协作。RPent用三层接口实现这一分离:
- MCP统一描述可调用的能力,无论底层是VLA、程序化技能还是其他工具,规划器都可以通过统一定义进行选择和调用;
- RPC连接工具、模型服务与机器人环境,让真实设备、仿真平台、本地进程和远程服务可以独立部署;
- MHS面向更广泛的物理设备提供统一的读写与控制抽象,让智能体未来能够从机器人扩展到实验仪器、家庭设备和工业系统。
通过MCP、RPC与MHS的分层设计,RPent正在构建一套连接模型、工具、机器人与物理设备的统一接口体系,让智能体能够像调用数字工具一样调用物理能力,从“操作数字资源”进一步走向“操作真实世界”。
记忆系统:让经验持续沉淀复用
能完成一次任务,并不意味着真正拥有了这项能力。在物理世界中,试错的成本远高于数字环境:一次失败的抓取可能需要重新布置场景,一次错误操作甚至可能造成设备损坏。如果每次执行结束后经验随即消失,智能体就只能反复从零开始。RPent的Memory系统正是为了解决这个问题,让一次探索产生的经验,成为未来任务执行的基础。
RPent将经验按复用范围组织为三层记忆,并为每条记忆记录适用范围、类型、可信度和支撑证据。新的经验需要经过验证后才能提高可信度,相互冲突的记录会被保留和隔离,避免偶然成功污染已有能力。记忆机制中包含Recipe,也就是可迁移的任务方案,而非某一次执行中的固定坐标。例如,系统可以记录“先根据任务描述和当前画面确认目标,再调整夹爪位置,调用VLA完成抓取,并检查抓取结果”的操作过程。当物体位置改变时,智能体可以重新观察环境,再复用相同的逻辑,而不是直接沿用原来的坐标。
探索模式允许更新记忆,评测模式则只读使用已经冻结的经验,让演进过程更加可控。在LIBERO-Pro Goal实验中,引入记忆机制后,RPent在任务扰动环境下的表现有了明显提升:在位置交换任务中,成功率从31.0%提升至87.0%。此外,RPent支持记忆资产分发,一次探索产生的经验可以同步至其他智能体,让单个智能体获得的能力能够成为整个系统持续进化的基础。通过Memory系统,RPent将智能体从“一次性完成任务”推进到“持续学习和积累经验”,让智能体的能力不再完全依赖模型预训练,而是在真实世界的交互中不断增长。
延时优化:Flash Mode加速任务执行
将大模型引入机器人控制回路,为智能体带来了更强的理解和规划能力,但也带来了新的挑战。大模型的推理速度通常远慢于机器人的动作执行速度,在物理环境中,等待模型生成下一步决策可能成为整个系统的主要延迟来源。因此,RPent并没有单纯追求更快的大模型,而是通过架构优化减少不必要的调用,让智能体的运行节奏更加贴近真实世界。
在实际应用中,大量机器人任务具有较强的重复性:任务目标和执行逻辑基本稳定,变化的主要是物理位置、姿态和环境状态。对于这类任务,如果每次都从头进行完整规划,无疑会产生大量重复推理。RPent通过Flash Mode来解决Agentic Planner应用于真机时的加速问题,其核心技术载体是任务卡(Task Card)。在探索阶段,RPent允许规划器调用大模型、VLA和程序化技能,尝试不同的动作组合,并将成功且经过验证的任务流程压缩为Task Card。Task Card会保存任务阶段、动作原语、关键目标与检查条件,但不会保存只能在一次场景中使用的固定坐标。
进入Flash Mode后,系统会优先按照Task Card执行:视觉模块重新定位关键物体,执行模块根据当前状态调整动作;只有在检查失败、环境偏离或流程无法继续时,才重新调用规划器处理。这样既保留了大模型应对变化的能力,也避免在稳定流程中反复进行高成本的推理。在LIBERO Object的200次评测中,开启Flash Mode将平均执行时间从283.6秒降低至40.9秒,在成功率仅下降3.5个百分点的情况下,实现了约7倍的加速。这也是演示场景中Flash Mode的技术含义:把探索得到的成功方案转化为可以快速复用、同时保留环境适应能力的执行流程。RPent将已经验证的任务逻辑沉淀下来,在环境发生变化时仅做必要调整,让具身智能体从“每次重新规划”走向“经验复用执行”——不只是记住过去做过什么,更能将已有经验转化为更高效的行动。
性能评测:协同框架的显著优势
为了清晰展示不同技术路线和配置的性能与延时表现,RPent推出了Leaderboard板块,相关页面链接为https://rpent.readthedocs.io/zh-cn/latest/rst_source/leaderboard.html。
在LIBERO-Pro基准测试中,RPent/GPT-6 Astra达到了92.63%的成功率,比第二名RPent/Opus-4.7的82.4%高出10.23个百分点,比π_RLinf的50.0%高出42.63个百分点。此外,开启了Flash Mode的RPent明显降低了系统延时。在RoboCasa365 Target50的厨房长程任务中,RPent/GPT-6 Astra达到59.20%,位列第一,高于RPent/GPT-5.5的57.1%,这说明更强的基础模型经过RPent的工具组织、记忆与执行闭环后,能够有效转化为物理任务能力。其余榜单也显示了RPent对不同模型与执行配置的兼容性:RPent/Opus-4.7在LIBERO测试中达到96.0%;RPent/GPT-5.5在RoboTwin测试中达到62.4%,均处于领先位置。值得关注的不是某一个模型单独完成了全部控制,而是通用模型、专家模型、工具和记忆系统可以在同一框架内协同发挥作用。
总结:物理世界的智能基础设施
从Codex、Claude Code到RPent,人工智能正在从“在数字世界完成任务”,走向“在物理世界完成任务”。当智能体走向真实世界,变化的不只是模型能力的边界,也包括支撑这种能力运行的基础设施形态。机器人需要看见环境、理解任务、调用不同能力、完成精细动作,还需要根据真实反馈不断调整策略,并把已经验证过的经验保留下来。
因此,围绕这一完整过程来组织智能体系统的RPent,并非只是一个开源的“让大模型控制机器人”的框架,而是一套能够连接模型、工具、机器人与环境,并支持智能体在真实世界中持续运行、积累经验和不断递归演进的智能中枢。从一次任务,到一类任务;从一次执行,到持续进化,RPent所代表的,正是大模型真正走进物理世界之后,需要重新构建的下一层基础设施。项目开源地址为https://github.com/RLinf/RPent。

