面壁智能发布具身智能模型,本地无网部署+高推理速度

7月19日WAIC展会期间,企业发布开源具身智能系列模型MiniCPM-Robot,包含两大核心模块
本次推出的MiniCPM-Robot系列覆盖机器人操作与移动导航两大核心场景
-
首款模型专注操作执行:MiniCPM-RobotManip为通用VLA模型,参数规模1.5B,支持本地部署,可让机器人结合视觉画面与语音指令输出对应动作
该模型可在真机完成三明治制作等实操任务
-
第二款模型负责移动导航:MiniCPM-RobotTrack由企业与南京大学合作开发,参数0.9B,原生适配宇树Go2 Edu机器狗,支持纯本地部署
搭载该模型的机器狗可在开放环境实现零样本指令跟随
简单来说,两款模型分别解决了具身机器人的操作与移动核心需求
同期发布的推理框架PhyAI,由明体科技联合北邮、北大研发,支持端云一体全栈优化,为本次具身模型落地提供底层技术支撑
该企业长期深耕轻量化大模型端侧部署,旗下MiniCPM系列在开源社区广受认可,多模态模型MiniCPM-V/O历经两年多迭代,总下载量突破2500万。今年具身智能赛道热度攀升,企业在端侧的技术积累恰好匹配当前行业三大痛点:本地部署、上下文管理、推理优化
上下文记忆优化
具身智能模型的核心挑战之一是时序记忆能力,常规模型与机器人原生不具备时序记忆,也无法独立完成计数类任务。比如让机器人按动按钮5次,多数现有设备要么仅触发一次,要么持续按压无法精准控制
这类问题的根源在于主流架构未预留时序记忆计算空间,而机器人需要本地高频推理,每秒需处理多组图像输入,若直接加载全部历史画面会导致token数量爆炸,无法实时运行
高效视觉token压缩是端侧多模态模型的基本功,也是MiniCPM-V系列的核心优化方向。本次推出的MiniCPM-RobotManip基于今年5月发布的MiniCPM-V 4.6训练,该模型发布后两个月下载量突破200万,在视觉token压缩上做到极致,同时实现了具身场景的时序记忆优化
即使加载历史观测数据进行流式推理,该模型的计算量也与单帧反应式推理基本一致。在专门的VLA上下文记忆基准测试RMBench中,主流模型成绩接近随机猜测,而该模型拿到53分,处于行业第一梯队,其他传统榜单也表现优异
不同于多数VLA团队从单一场景切入再扩展全品类,该企业作为模型训练团队,从起步就面向通用智能开展多任务统一训练,综合编码效率更高
纯本地无网部署能力
具身智能落地常出现「demo惊艳、落地翻车」的问题,脱离网络后设备表现往往失控,比如电梯、地下停车场等信号薄弱场景,同时家庭工厂场景中云端传输画面会带来隐私合规风险。随着机器人进入日常场景,VLA必须支持本地运行
对于该企业来说,端侧部署已是成熟技术方向,本次的MiniCPM-RobotTrack严格遵循本地部署标准:基于自研MiniCPM4底座,搭配原装摄像头与机载算力,仅需一键脚本即可完成部署。该模型是业内首个真实本地纯无网部署的tracking模型,在机器狗原生算力上可稳定实现5+ FPS帧率,端到端时延约180毫秒
即使采用纯本地部署,模型性能也未打折扣:在单目标跟踪、多人干扰、模糊指令三类真实场景测试中,追踪率分别为89.8%、73.4%、80.4%,在开源方案中全部最优。对比OpenTrackVLA分别高出7.0、14.6、6.5个百分点;对比闭源方案TrackVLA++,在相同单视角、纯SFT设定下,单目标跟踪与模糊指令两项分别领先8.8和17.0个百分点,模糊指令成功率达58.0%
该模型的优异表现源于团队搭建的DAgger闭环自进化数据管线:先在大规模通用数据上完成基础预训练,再将模型投入仿真与真机环境持续交互,暴露横穿镜头、快速转向、短时遮挡等短板场景,系统定向采集薄弱场景数据,用专家策略补充高质量训练数据后回传再训练
该无网部署方案可应用于地震火灾等通信瘫痪的救援场景,未来「断网测试」或将成为具身智能的标准出场测试项
推理性能优化
常规大模型卡顿仅影响使用体验,但机器人作为落地设备绝对不能出现明显延迟。比如帮用户拉拉链时延迟半秒可能造成误伤,因此机器人操作的响应时间有明确红线,过长延迟会让设备失去实用价值
压低响应时间需要从算力、参数规模、推理优化三个维度优化:
-
算力层面当前硬件上限并非普通团队可自主决定,暂不纳入本次讨论
-
参数规模方面,当前主流VLA模型普遍采用3B左右的参数规模,进一步提升参数不会带来体验的明显改善
-
推理优化正是端侧AI团队的核心强项
本次发布的PhyAI框架在发布首日就完成了对MiniCPM-Robot系列的适配:通过CUDA Graph加速,推理帧率从10.12Hz提升至33.28Hz;再通过Triton编写定制融合算子,减少中间变量搬运,在H20平台上将帧率进一步提升至36.77Hz
该框架的优化能力可覆盖行业通用模型:在RTX 5090上运行π0、π0.5、GR00T,分别实现2.85、1.82、2.28倍的性能加速
落地应用场景
目前公开的落地合作有两条线路:
第一条是与乐聚机器人合作,推出展厅导览与园区巡检两套方案:展厅导览支持无网纯端侧运行,可离线讲解本地知识库、自由问答,同时实时理解展厅环境并规划避障路线;园区巡检可监控违停车辆、路面异常、公共设施异常,敏感画面就地分析,数据主权完全归客户
第二条是与吉利的工业场景合作,双方从模型层联合训练VLA,通过RoboHarness框架整合多模态大模型、VLA与导航系统,在仓储场景开展长程任务测试,并内置数据闭环实现持续迭代优化
总结与招聘
整体来看,该企业正式入局具身智能赛道,依托端侧技术积累推出全套解决方案。做通用人工智能的企业,最终都需要从虚拟语言世界走进物理现实,该企业的路径也为同行提供了新参考:机器人的技术卡点未必只能从自动化领域寻找答案
此外,该企业目前正在招募具身智能方向的专业人才,有意向的求职者可通过官方内推渠道投递简历


