文章摘要
近日,谷歌发布多模态机器人控制模型Gemini Robotics 2(GR2),可让机器人完成从移动到精细操作全流程任务,能同时驱动腿部与手部,简化训练与设计流程。它通过相机图像和文本指令输出关节控制命令,适配多种机器配置。目前仅对早期伙伴开放,未公布模型卡等信息。官方测试显示其在不同任务有不同成功率,还推出配套模型,有望实现知识迁移。

近日,一款全新的多模态机器人控制模型正式发布,它可以让人形机器人完成从移动到精细操作的全流程任务:自如穿过房间行走、蹲下抓取低处架子上的物品,还能通过五指手掌精准握住并操作灯泡。这款模型是相关机器人系列中的首个突破,能够通过同一套训练权重同时驱动机器人的腿部与手部,大幅简化了模型训练与整体设计流程。

核心模型介绍

此次发布的Gemini Robotics 2(简称GR2),是一款可以将相机采集的图像与文本指令转换为机器人关节控制指令的模型。此前的同系列早期模型仅能驱动桌面场景下的机器人上半身操作,而GR2可以同时控制人形机器人的腿部、躯干、手臂与手部。该模型仅需一组固定的训练权重,就可以支持两种机器人本体下的三套机器配置运行。

核心特性

• 输入输出逻辑:通过相机图像与文本指令作为输入,输出机器人关节控制命令,可以适配带有22个自由度的五指手(Sharpa或Inspire手),或是简单的双指夹爪(Robotiq)。

• 多本体支持:单个训练检查点就可以同时适配三种机器配置,包括搭载Sharpa手的Apptronik Apollo 2人形机器人、搭载Inspire手的同型号Apollo 2机器人,以及搭载Robotiq夹爪的Franka Duo双臂机械臂系统。

• 性能表现:官方公布的自报成功率覆盖三类任务:全身拾取任务成功率在45.7%至76.3%之间,多指精细操作任务在32%至92%之间,夹爪任务则在74.2%至89.6%之间。

• 开放情况:目前仅对早期访问合作伙伴开放,暂无公开API接口。

• 未披露信息:官方并未发布该模型的模型卡,也未透露基础模型架构、参数量、训练数据构成以及具体售价。

模型工作逻辑

此次发布的GR2搭配了独立的推理模型Gemini Robotics ER 2,后者可以将复杂任务拆解为多个步骤,并逐个调用GR2完成执行。由于官方并未发布GR2的模型卡与技术论文,目前我们所能获取的信息仅来自其安全报告与官方公告。

模型的训练采用了遥操作、视频示例与仿真结合的方式:遥操作指通过人工远程操控机器人,记录完整的动作流程,再将这些数据用于模型训练。

GR2无需针对不同机器配置单独训练版本,仅通过一组训练权重即可适配三套系统。这一技术依托于Gemini Robotics 1.5版本引入的运动迁移能力:在训练过程中,模型会学习来自不同形态、传感器配置与关节数量的机器人数据,让不同硬件平台上记录的操作数据可以互相复用,实现知识在不同机器人配置间的迁移。

官方测试表现

所有测试均在官方自定义的任务与硬件平台上完成,目前暂无第三方团队发布独立测试结果。官方将全身拾取与夹爪任务的指标报告为同类别多项任务的平均值,而多指精细操作任务则以单个任务的结果呈现。目前可参考的基线模型是官方在2025年3月发布的首款机器人模型,该模型适配双臂Franka机器人后,在对应任务上的平均得分为63%。

针对搭载Inspire手的Apollo 2机器人,在利用腿部辅助拾取物体的测试中,从架子上拾取的成功率为76.3%,桌面拾取为68.4%,地面拾取为45.7%,所有结果均为对应类别下多项任务的平均值。

搭载Sharpa手的Apollo 2在精细手部操作测试中取得了官方公布的最低成绩:系垃圾袋成功率为44%,封合拉链袋为40%,用簸箕清扫为32%。

在Franka Duo双臂机械臂系统上,GR2在精确插入、工具配套与通用抓取放置任务上的平均成功率分别为89.6%、78.9%与74.2%,该任务清单与初代Gemini Robotics模型的测试内容略有差异。

Gemini Robotics ER 2对机器人是否具备执行任务的物理可行性的判断准确率,取决于其获取的GR2训练摘要信息:如果没有训练摘要,判断正确率为62.0%;如果提供高度详细的训练摘要,正确率可以提升至95.8%。

官方同时推出了安全基准ASIMOV-Agentic,测试结果显示所有参与测试的系统,包括官方自身的模型,都无法同时实现两个目标:准确识别移动机器人对人类的安全风险,同时避免无意义的停机。如果将不必要的停机率控制在5%以下,就会漏掉超过40%的人类近距离靠近的场景。因此官方建议,这类机器人模型应当与传统物理安全设备配合使用,而非完全替代后者。

典型操作案例:拧灯泡

官方公布的测试数据显示了反向操作的难度差异:拧下灯泡的成功率为92%,是所有手部操作任务中最高的成绩;而拧入灯泡的成功率仅为36%。拧下灯泡的任务从灯泡已经安装在灯座的稳定状态开始,机器人仅需要抓握并旋转即可完成;而拧入灯泡则需要先精准对齐灯泡与灯座,同时还要用手掌包裹住灯泡保持稳定,操作难度大幅提升。

配套模型与行业意义

此次发布还同步更新了Gemini Robotics ER 2推理模型,该模型负责规划任务步骤、从视频流中跟踪操作进度,并将动作模型作为工具调用。另外一款Gemini Robotics On-Device 2模型可以在机器人本地硬件上离线运行,仅需几小时、不到200个示例样本,就可以适配一款全新的双臂机器人本体。

当前多数机器人模型仅能针对单个任务、单台硬件与单一环境进行训练,哪怕只改动一个变量,都需要重新从头开始训练。与视觉-语言模型所依赖的海量文本与图像语料库相比,机器人运动数据的规模要小得多。GR2系列模型尝试使用更通用的数据进行训练,目标是实现像基于Transformer的语言模型那样,将知识从一种机器人配置无缝迁移到另一种,无论改动的是手部类型、关节数量还是执行的任务类型。

按照当前拧入灯泡36%的成功率,大约不到三台GR2机器人,就能完成一次成功的灯泡安装操作。

以上内容不代表本平台立场,仅供读者参考