文章摘要
7月30日,谷歌旗下DeepMind团队发布Gemini Robotics 2机器人AI模型。该模型可驱动多种智能设备,加入全身控制、灵巧操作和多机协作等能力,能支持离线运行与硬件快速适配。演示中效果亮眼,搭载多个AI模型提升机器人能力。此外,模型强化了安全设计,目前部分版本已上线或开启预览,它是软件层面模型,适配不少中国制造硬件。

7月30日,谷歌旗下DeepMind团队发布了Gemini系列的最新机器人AI模型Gemini Robotics 2。这款模型能够驱动包括人形机器人在内的多种智能设备,让机器人自主适应复杂多变的真实环境,对每一步操作都能进行独立推理,从而可以完成从清理垃圾、搬运洒水壶到整理桌面等多样化任务。此次更新加入了智能全身控制、高级灵巧操作和多机器人协作三大核心能力,标志着机器人技术迈入了全新的发展阶段,为下一代具备全面适应能力的机器人提供了核心智能支撑。

初代Gemini Robotics系统仅能通过机械臂和机械手完成封口储物袋、折叠折纸这类精细操作,而新版本则大幅拓展了能力边界。不仅如此,这套智能系统还支持在设备本地离线运行,并且可以在数小时内无缝适配全新的机器人硬件平台,让机器人学到的操作技能能够快速迁移到不同机型上,甚至可以让多台不同类型的机器人协同完成任务,大幅提升工作效率。

实现“智能全身控制”,演示效果惊艳

谷歌发布了搭载该模型的机器人操作演示视频,效果亮眼。首先,该模型将物理AI的应用场景从桌面任务拓展到了人形机器人领域,实现了完整的全身智能控制。比如Apptronik的Apollo 2人形机器人在接到“将洒水壶放入底层架子的绿色箱子”的指令后,可以自主走到桌边拿起水壶,再精准走到架子旁完成放置。

要在家庭和办公场景真正发挥作用,机器人需要具备高精度的精细操作能力。演示中机器人完成了将书籍上架、收拾棋盘、将磁带放入手提录音机、整理桌面等多项任务。Gemini Robotics 2还支持多种硬件平台,能够通过22自由度的五指SharpaWave机械手完成打结、密封夹链袋这类极度精细的动作,也可以通过标准两指平行夹爪(如Franka Duo平台)完成紧密包装等复杂任务。

根据谷歌内部的评估数据,三类全身操控任务的成功率在45.7%到76.3%之间,三类Franka Duo抓取任务的成功率在74.2%到89.6%之间,多指操作任务的成功率则在32%到92%之间。

值得一提的是,谷歌强调演示视频中的机器人是完全自主运行的实时录像,这与马斯克旗下Optimus机器人此前的演示形成了鲜明对比,后者曾被曝出使用远程操作员控制机器人动作。同时需要说明,目前这些机器人并非通用型设备,所有任务都是经过针对性训练完成的,训练结合了人工远程操作、视频示例和模拟仿真三种方式。

三大核心模型,建构机器人超级大脑

当前市面上的多数机器人都是预先编程或者远程操控的,只能执行狭窄的重复性任务,既无法自主学习适应未知环境,也很难将技能从一个机器人平台迁移到另一个平台。DeepMind团队认为,要应对大规模复杂场景的挑战,不同形态和尺寸的机器人都需要搭载AI模型,获得智能思考、行动和交互的能力,才能安全高效地完成任务。

此次Gemini Robotics 2通过搭载多个AI模型,让机器人具备了多模态环境理解能力:其中一个视觉语言模型负责环境理解,另外两个视觉语言动作模型分别控制全身动作和手部精细操作。根据团队负责人Carolina Parada发布的公告,Gemini Robotics 2包含三个核心模型,各自承担不同职能。

Gemini Robotics 2作为最先进的视觉-语言-动作(VLA)模型,能够将视觉和语言输入转化为电机控制指令,实现从足部到指尖的完整人形机器人控制,大幅提升双手和夹爪的灵巧操作能力,首次实现了将人类意图转化为人形机器人的全身智能动作。

Gemini Robotics ER 2是一款具身推理视觉语言模型,扮演了机器人的“大脑Agent”角色,可以和人类进行自然沟通、理解物理空间规则,并规划长达数分钟的多步骤任务流程,还新增了多机器人协作功能,不同类型的机器人可以互相通信协同,完成单个机器人无法独立完成的复杂工作流。在代理推理能力上,ER 2可以处理包含数百个决策节点的复杂任务,具备自我修正机制,能够支持多机协同完成高负荷工作流。

Gemini Robotics On-Device 2是针对需要离线运行、无网络延迟的场景打造的本地运行VLA模型,具备极高的适配效率。该模型原生支持多机器人平台适配,继承了Gemini Robotics 1.5的先进“运动迁移”技术,仅需要不到200个示例样本,就能在数小时内完成对全新双臂机器人平台的适配,即使面对硬件形态、传感器配置和自由度差异极大的新机型,这套适配方案同样有效。

目前,Gemini Robotics ER 2已经在Google AI Studio上线,并在Gemini Enterprise Agent Platform开启私人预览;而VLA模型和本地运行模型则仅对早期合作伙伴开放。

强化安全设计,打造可靠协作机器人

团队负责人Parada表示,安全问题在机器人落地场景中尤为紧迫,因为机器人会面对大量未知场景,存在诸多不确定性,因此团队深入研究了机器人的安全保障方案。谷歌采取了多层次的安全保障策略,将传统物理安全措施和强大的AI安全框架相结合,确保未来机器人的使用安全。

Gemini Robotics 2特别强化了应对真实场景不确定性和人机协作的安全能力,团队推出了ASIMOV-Agentic基准,用于评估代理式安全编排和不确定性解决能力:该基准可以衡量具身推理智能体拒绝不安全工具调用请求的能力,也可以评估智能体预测任务完成可能性、并在任务不明确时主动请求人工干预的能力。通过增强的具身推理能力,Gemini Robotics ER 2是团队迄今为止最安全的机器人模型,在安全约束遵循和人类接近度检测上表现出色,可以精准识别人类靠近的信号,触发安全停机操作,并在区域无人后自动恢复工作。

另外需要注意的是,谷歌此次推出的是软件层面的AI模型,而非机器人硬件本身。近期美国以安全为由禁止未来销售中国制造的机器人,而这款软件可以运行的诸多硬件平台,恰好有不少是中国制造的。

以上内容不代表本平台立场,仅供读者参考