谷歌旗下的 DeepMind 发布了新版机器人模型 Gemini Robotics 2,这套系统能够驱动多种不同形态的机器人,其中包括可以完成拧灯泡、系垃圾袋等精细动作的人形机器人。

与以往版本相比,最大的变化在于控制范围。此前的模型主要负责机器人上半身在桌面场景下的操作,而新模型能够统一管理整台人形机器人的行走、下蹲、伸手与抓取,从”脚到指尖”由同一套策略接管。
三个模型分工协作
Gemini Robotics 2 并非单一模型,而是把几套模型整合进同一个系统。
其中,视觉语言模型负责理解图像和视频,与人类沟通并推理任务该怎么完成;两个视觉语言动作模型经过空间运动训练,分别控制机器人的全身动作以及夹爪或机械手的动作。
按 DeepMind 的划分,这套体系包含三个成员:Gemini Robotics 2 是核心的动作模型,把视觉感知和自然语言指令直接转换成电机控制信号;Gemini Robotics ER 2 是负责具身推理的高层”大脑”,承担任务拆解、进度跟踪与多机协调;Gemini Robotics On-Device 2 则是可在机器人本地硬件上运行的小型版本,面向延迟敏感或网络不稳定的场景。
在发布前提供的演示视频中,多台不同机器人依靠这套模型自主完成了复杂任务。其中一段演示里,Apptronik 公司的 Apollo 2 机器人搭配 Sharpa 公司提供的机械手整理货架。收到”把洒水壶放进下层货架的绿色箱子”这样一句指令后,机器人会先观察现场,走到桌边取起水壶,再移动到货架前下蹲,把物品放进指定位置——整个过程不需要拆成一段段预设子程序。
DeepMind 表示,这些能力是通过人类遥操作、视频示范与仿真数据混合训练出来的。目前的人工智能模型还做不到在完全没有针对性训练的情况下完成大量复杂任务。
成绩单并不完美
DeepMind 公布的自测数据显示,不同任务之间的差距相当明显。
在搭配 Inspire 机械手的 Apollo 2 上,通用全身操作的准确率为:从桌面取物 68.4%,从地面取物 45.7%,从货架取物 76.3%。换成 Sharpa 的 SharpaWave 触觉手后,精细动作的表现更加参差:拧上灯泡 36%,拧下灯泡 92%,系垃圾袋 44%,簸箕任务 32%,密封袋任务 40%。DeepMind 也承认,多指灵巧操作仍然是难点。
相比之下,使用两指夹爪的 Franka Duo 平台成绩更稳:通用抓放 74.2%,多样化工具分拣 78.9%,精密插入 89.6%。这组对比说明,五指机械手远未被攻克,可靠的夹爪作业与仍显脆弱的拟人化操作之间,差距还在拉大。
高层推理模型 ER 2 的进步则较为扎实。它可以观察房间环境、逐步推理、与动作模型协同、跟踪进度,并在某一步失败时自我纠正,支撑持续数分钟、包含数百次决策的任务序列。它还能协调多台机器人——包括不同类型的机器人——彼此沟通、分工完成同一套流程。
本地运行的 On-Device 2 主打快速适配:面对全新的双臂机器人形态,只需几小时数据、通常少于 200 个示例,就能完成迁移,即便机器人的外形、传感器和自由度各不相同。
安全问题被摆到台前
把前沿模型接入机器人,让它们在工作场所或家庭里自由活动、操作物品,风险不容忽视。已有研究显示,用前沿人工智能控制机器人可能产生意料之外、有时甚至危险的行为。
“安全问题变得更加紧迫,因为你把它们放进了大量其他情境中,”谷歌 DeepMind 机器人负责人 Carolina Parada 对 WIRED 表示,”会冒出很多不确定性,所以你需要能够更深入地理解安全问题。”
Parada 介绍,谷歌采取分层防护思路,在每一层模型上都设置护栏。与新模型一同推出的还有 ASIMOV-Agentic——一套用于衡量多个人工智能系统协同控制机器人时安全性的新基准,可以检测某条指令是否会导致有害或不确定的后果。该基准已在模型托管平台上公开。DeepMind 称,ER 2 是其迄今在安全约束遵循和人体接近检测方面表现最好的机器人模型,能够识别靠近的人员、触发安全调用并让机器人平稳停下。
Parada 还给出了一句更具野心的表述:”这是我们通往所谓物理通用人工智能道路上的又一个里程碑,意思是让机器人能做人类能做的任何事。”
谷歌的另一张牌
在聊天机器人和编程工具领域,Anthropic 与 OpenAI 走在前面,但谷歌在机器人研究上积累更深,此前已发表多项用人工智能训练机器人完成实际任务的重要成果,也曾与腿式机器人领域的领先企业波士顿动力合作,为其机器提供”大脑”。这次发布再次表明,这家搜索巨头押注人工智能必须走出数字世界,才能释放全部潜力。谷歌 DeepMind 首席执行官 Demis Hassabis 此前对 WIRED 表示,他希望打造一套适用于各类机器人的人工智能操作系统,类似智能手机领域的安卓系统。
从开放程度看,ER 2 已面向开发者开放,可通过 Google AI Studio 与相关接口调用;动作模型和本地模型目前仅向早期合作伙伴提供。
来源:WIRED《Gemini Robotics 2 Brings Google’s AI Into the Physical World》,作者 Will Knight;测评数据与模型开放情况参考 Google DeepMind 官方发布内容整理。
发表回复