文章摘要
面壁智能发布并开源两款具身智能模型,即MiniCPM - RobotManip和MiniCPM - RobotTrack,解决具身智能上下文记忆与无网导航难题。前者依托视觉Token压缩技术,在主流VLA基准测试表现优异;后者在无网环境下跟踪成功率领先。同时发布的推理框架PhyAI可加速模型推理,且公布了多项落地合作案例,是通用人工智能进程重要探索。

想要让机器人完成“按这个按钮五次”的指令,往往会遇到棘手的问题:多数主流的视觉-语言-动作(VLA)模型要么按下一次就停止,要么陷入循环无法终止,核心原因在于它们无法记住已经完成的操作次数,也就是缺乏必要的上下文记忆能力。

这一痛点背后,正是具身智能领域长期未能妥善解决的上下文记忆难题。近期,相关团队在行业大会上发布并开源了两款具身智能模型,分别为专注于机械操作的MiniCPM-RobotManip,以及负责目标跟踪与导航的MiniCPM-RobotTrack,旨在从技术层面破解这一困境。

具身智能的核心瓶颈:上下文记忆缺失

当前主流的具身智能模型采用视觉-语言-动作的闭环逻辑:机器人通过摄像头采集画面,理解语言指令后输出对应的机械动作,这套流程需要每秒重复多次才能完成连贯操作。但绝大多数现有VLA模型仅依赖当前单帧画面进行决策,完全忽略了历史观测与已执行的动作,导致无法完成需要多次重复或多步骤连贯的任务。

从技术角度来看,若要引入上下文记忆,需要将历史画面、动作数据一并纳入模型推理,这会导致计算量呈几何级增长。受限于算力与推理速度的双重压力,多数团队只能放弃上下文记忆,退回到“看一帧、算一步”的简单模式。

差异化的研发路径

与多数团队从细分场景切入、逐步拓展通用能力的路线不同,该系列模型从研发之初就瞄准通用具身智能的目标,希望让机器人能够完成叠衣服、制作三明治等多步骤贴近真实生活的任务,再将通用能力落地到具体场景中,形成“从通用到细分”的研发逻辑。

视觉Token压缩:破解算力与记忆的平衡难题

该系列模型的核心技术支撑来自团队在多模态大模型领域的积累,其操作类模型MiniCPM-RobotManip基于今年5月发布的最新多模态大模型训练完成,而该系列模型的标志性技术——视觉Token极致压缩,正是解决上下文记忆与算力平衡的关键。

在机器人的实际应用中,每次推理通常需要同时处理来自多个摄像头的画面与语言指令,画面在输入模型前会被转换为模型可识别的Token,画面信息量越大,所需Token数量越多,计算负担也就越重,推理速度越慢。通过极致压缩视觉Token,在不损失关键信息的前提下减少计算量,能够显著提升推理速度,尤其在处理连续画面时效果更为明显。

依托这一技术,MiniCPM-RobotManip能够在引入历史观测数据的同时,将整体计算量控制在与传统单帧模型相当的水平。通过流式计算的优化方案,带记忆的推理成本追平了传统反应式模型,且该模型的参数规模比同类竞品更小。

性能实测表现

根据主流VLA基准测试结果,MiniCPM-RobotManip的综合性能位列第一梯队,与同类主流模型性能相近甚至更优。值得关注的是,该模型保留了多模态大模型的通用能力,在仿真评测场景中采用通用多任务统一训练,指标达到专家模型水平。在需要上下文记忆的测试榜单中,同类竞品仅获得接近随机的低分,而MiniCPM-RobotManip的得分大幅领先,展现出优异的上下文记忆能力。

离线跟踪:破解无网环境下的导航难题

如果说MiniCPM-RobotManip解决的是机器人操作时的上下文记忆问题,那么MiniCPM-RobotTrack则瞄准了另一类基础需求:机器人在无网络环境下能否正常工作。

用户只需向MiniCPM-RobotTrack下达“跟随穿黑色衣服的人”这类指令,机器狗就能持续锁定并跟随目标,即使周围有其他人员干扰,或是目标短暂被遮挡,也能保持较高的跟踪稳定性。该模型基于团队自研的轻量化模型与MLP结构训练完成,参数规模仅0.9B,比操作类模型更小。无需额外加装感知模块或外接开发板,仅依靠机器狗自带的摄像头与本地算力,就能完成单目标跟踪、动态多目标跟踪以及模糊指令下的目标跟踪。

官方公布的评测数据显示,该模型在三项细分能力上的跟踪成功率均处于行业领先水平,是当前开源方案中的最优结果。

这一成果背后离不开两套核心支撑:一是“自主查漏补缺”的数据管线,团队先让模型在大规模通用场景数据上训练,再放入仿真环境与真实机器人中反复试跑,主动暴露复杂场景下的短板,针对性收集薄弱场景的数据并迭代训练;二是系统级的工程优化,团队围绕特定机器狗的完整运行链路进行全流程优化,最终在本地算力上实现稳定的运行效率,同时开源完整部署流程,让用户可以快速完成部署。

纯本地部署带来了多重优势:无需等待网络传输与云端响应,机器人对目标移动与环境变化的反应更及时;用户的画面与指令无需上传云端,隐私风险大幅降低;即使在弱网或无网环境下,系统也能正常工作,比如在信号缺失、人员进出频繁的电梯场景中,该模型就能仅凭机载摄像头与本地部署的模型完成指令识别与目标跟踪。未来这类能力还可应用于楼宇巡检、灾害救援等通信基础设施不可靠的场景,协助完成目标搜寻与跟随任务。

适配高效的推理加速框架

模型的落地效果还依赖配套的推理框架。本次与两款模型一同发布的还有推理框架PhyAI,由相关团队联合高校共同研发,专门针对具身智能模型的端侧极速推理与云端大规模强化学习训练进行优化。

根据官方数据,该推理框架在主流显卡上运行多款主流VLA模型时,实现了显著的推理加速。更值得一提的是,本次发布的机器人模型在发布当天就完成了适配,通过定制优化方案进一步提升运行效率,确保用户从发布之初就能高效使用该模型。

真实场景落地实践

本次行业大会上,团队还公布了多项落地合作案例:与合作方推出展厅导览与园区巡检解决方案,机器人可在无网络的场馆与园区角落完成本地讲解与异常识别;与车企联合训练专用VLA模型,并通过自研的具身智能体框架,将多模态大模型、VLA模型、机器人本体与导航系统整合,落地到生产仓储场景中,让机器人能够规划并执行长链条的复杂任务。

该框架的核心思路是将各类智能模块作为物理世界的工具,由上层模型负责任务规划与调用,同时为系统提供长程任务所需的上下文与记忆管理,支持多种任务编排方式,并配备失败重试与恢复机制。机器人在真实场景中执行任务时产生的数据,还会通过可治理的数据闭环反哺模型,实现持续进化。

相较于单一模型的跑分数据,这些真实场景的合作案例更能体现具身智能距离真正走进日常生产生活的实际进展。

行业展望与总结

真正的通用人工智能,绝不能仅停留在虚拟屏幕与语言对话的层面。只有当语言层面的认知智能与物理层面的执行智能实现完美打通,通用人工智能的终极目标才会真正到来。而本次发布的具身智能系列模型,正是这一进程中的重要探索。

以上内容不代表本平台立场,仅供读者参考