Gemini Robotics 2 为机器人带来全身智能

查看原文 HN 讨论

文章摘要

Google DeepMind 于 2026 年 7 月 30 日发布 Gemini Robotics 2,作者为 Carolina Parada。官方的一句话概括是:从脚到指尖,我们正在教机器人智能的全身控制、精细的灵巧操作和团队协作,以完成范围广泛的复杂任务。

文章开头点明当前机器人的局限:多数机器人依靠预编程或遥操作来完成狭窄、重复的任务序列,缺乏真正自主学习或适应不可预测环境的能力,而且把学到的技能从一种机器人本体迁移到另一种本体依然极其困难。要在规模上解决最难的问题,各种形态和尺寸的机器人都需要能让它们思考、行动和智能交互的 AI 模型。

此次发布包含三个模型:

全身控制。文章指出世界是为人类的运动方式建造的,需要伸手、弯腰、在拥挤狭窄的空间里保持平衡。此前的模型只能控制人形机器人的上半身来完成桌面任务,Gemini Robotics 2 首次把物理 AI 扩展到全身运动。以 Apptronik 的 Apollo 2 人形机器人为例,可以对它说「把喷壶放到底层架子上的绿色箱子里」,Apollo 会理解指令、走到桌边、拿起喷壶、走几步到架子前并精确放置。文章诚实地承认机器人在移动速度上仍有很多需要推进的地方。

灵巧度。模型现在能控制 Apollo 2 上五指、22 自由度的 SharpaWave 手完成打结、密封拉链袋这类精细动作,也能操作 Franka Duo 平台上标准的两指平行夹爪完成紧密打包等复杂任务。文章配的性能图表显示,同一个模型检查点被用于三种不同本体(配 SharpaWave 手的 Apollo 2、配 Inspire 手的 Apollo 2、配 Robotiq 夹爪的 Franka Duo),在全身和基于夹爪的灵巧任务上达到中到高的成功率,但多指灵巧操作仍然困难。

智能体推理与多机器人协作。ER 2 充当机器人的高层大脑,处理用户指令、与人沟通、观察房间、推理完成任务所需的步骤、与 VLA 协调执行动作并跟踪进度直到完成。这让机器人能执行复杂的多步任务、在某一步失败时自我纠正、并泛化到新情境和新目标。本次更新让机器人能更可靠地执行持续数分钟、涉及数百个决策的更长任务序列;ER 2 现在能理解任务何时开始和结束,并精确定位关键事件发生的时刻。多机器人协作则让不同类型的机器人能相互通信、共同解决单个机器人无法完成的复杂工作流。

端侧适配。On-Device 2 天生支持多本体,继承了 Gemini Robotics 1.5 的「运动迁移」技术,现在可以在数小时的适配时间、通常少于 200 个示例的条件下适配新的双臂本体——即便新本体在形状、传感器和自由度上差异巨大,文章以 Dexmate、SO101 和 Trossen 三个平台上的多样化任务作为演示。

安全。文章介绍了新的 ASIMOV-Agentic 基准,用于评估智能体式的安全编排与不确定性消解,例如衡量具身推理智能体拒绝来自 VLA 的不安全工具调用的能力,以及预测任务是否可行、在不确定时主动请求人类介入的能力。得益于增强的具身推理,ER 2 是他们迄今在安全约束遵循和人体接近度基准上表现最安全的机器人模型,能更好地检测附近有人、触发安全工具调用并在有人靠得太近时让机器人安全停止——这是协作安全标准的关键要求。

ER 2 现已在 Google AI Studio 上线,并在 Gemini Enterprise Agent Platform 上提供私有预览;VLA 和端侧模型面向早期合作伙伴开放。

HN 评论精华

这个帖子拿到 620 分、538 条评论,是本期讨论量最大的一篇。讨论集中在三块:这项技术到底走到哪一步了、人形形态是不是个伪命题、以及机器人普及后的劳动与分配问题。

从业者的真实评估

「苦涩的教训」之争

人形形态之争

劳动、分配与家庭机器人的现实

其他