长期以来,大多数机器人只能按照预先编写的程序,或者在人工遥控下完成狭窄、重复的动作序列,既不会自己学习,也难以适应变化的环境。7 月 30 日,谷歌 DeepMind 发布了新一代机器人模型 Gemini Robotics 2,试图改变这一局面:它首次实现了对人形机器人”从脚到指尖”的全身智能控制。

DeepMind 机器人团队负责人卡罗琳娜·帕拉达在官方博客中表示,要想大规模解决最棘手的问题,各种形态和尺寸的机器人都需要 AI 模型赋予它们思考、行动和智能交互的能力,从而安全地完成任务。
一套系统,三个模型
Gemini Robotics 2 实际上是三个相互配合的模型组成的完整体系。
第一个是同名的视觉-语言-动作模型(VLA),负责把摄像头画面和自然语言指令直接转化为电机控制信号。与此前只能控制上半身、完成桌面任务的版本不同,新模型可以控制完整的人形机器人,覆盖行走、下蹲、伸展和双手操作。
第二个是具身推理模型 Gemini Robotics ER 2,相当于机器人的”高层大脑”。它负责理解用户指令、观察环境、拆解任务步骤、跟踪执行进度,可以规划持续数分钟、涉及数百个决策的长任务,还能在某一步失败时自我纠正。这次更新还引入了多机器人协作能力,让不同类型的机器人互相沟通、组队完成单台机器人无法胜任的复杂流程。
第三个是 Gemini Robotics On-Device 2,专为本地运行优化,不依赖网络连接。它继承了上一代的”动作迁移”技术,只需几个小时的适配时间、通常不到 200 个示例,就能移植到形状、传感器和自由度完全不同的新机器人身上。
演示效果:搬东西、打结、封袋子
在演示中,搭载新模型的 Apptronik Apollo 2 人形机器人接到一句指令——”把浇水壶放进底层架子的绿色箱子里”。它随即理解指令,走到桌边拿起浇水壶,再走几步到架子前,下蹲并把壶准确放进目标位置,整个过程由单一模型一气呵成,不需要在”行走程序”和”操作程序”之间切换。
在精细操作方面,该模型可以驱动 Apollo 2 上五指、22 个自由度的 SharpaWave 灵巧手完成打绳结、封密封袋这类精细动作,也能操控 Franka Duo 平台上的标准双指夹爪完成紧密装箱等任务。
不过 DeepMind 也坦承,机器人在动作速度上仍有很大提升空间,多指灵巧操作依然是难点。据科技媒体披露的基准数据,该模型在精密插入任务上的成功率约为 89.6%,拧灯泡约 92%,但系垃圾袋只有 44%、用簸箕扫地仅 32%——布料、塑料袋这类会变形的物体,仍是当前机器人学习的硬骨头。
安全与开放
随模型一同发布的还有名为 ASIMOV-Agentic 的安全基准,用于评估机器人智能体能否拒绝不安全的操作指令、能否在不确定时主动请求人工干预。DeepMind 表示,ER 2 是其迄今在安全约束遵循和人机近距离协作基准上表现最好的机器人模型,当有人靠得太近时,它能检测到并让机器人安全停止。
目前,Gemini Robotics ER 2 已经在 Google AI Studio 上线,并在 Gemini 企业智能体平台开启私测;VLA 主模型和端侧模型则面向早期合作伙伴开放。DeepMind 在致谢中点名了 Apptronik、波士顿动力和 Agile Robots 等硬件合作方。
与 Figure AI、特斯拉等选择软硬件垂直整合的公司不同,谷歌走的是开放平台路线:一个模型适配多家厂商的机器人,再配上开发者工具链。这场”机器人操作系统”之争才刚刚开始。
来源:Google DeepMind 官方博客(https://deepmind.google/blog/gemini-robotics-2-brings-whole-body-intelligence-to-robots/)