Gemini Robotics 2 为机器人带来全身智能
文章摘要
Google DeepMind 于 2026 年 7 月 30 日发布 Gemini Robotics 2,作者为 Carolina Parada。官方的一句话概括是:从脚到指尖,我们正在教机器人智能的全身控制、精细的灵巧操作和团队协作,以完成范围广泛的复杂任务。
文章开头点明当前机器人的局限:多数机器人依靠预编程或遥操作来完成狭窄、重复的任务序列,缺乏真正自主学习或适应不可预测环境的能力,而且把学到的技能从一种机器人本体迁移到另一种本体依然极其困难。要在规模上解决最难的问题,各种形态和尺寸的机器人都需要能让它们思考、行动和智能交互的 AI 模型。
此次发布包含三个模型:
- Gemini Robotics 2:最先进的视觉-语言-动作模型(VLA),把视觉和语言输入转换为电机控制。这个模型能控制完整的人形机器人(从脚到指尖),也能控制其他双臂机器人,并在双手和夹爪上都带来了新层次的灵巧操作能力。
- Gemini Robotics ER 2:最强的具身推理(ER)模型,是一个充当智能体的视觉语言模型(VLM),让机器人能与人沟通、理解物理世界、规划持续数分钟的多步骤任务,并首次支持机器人组队协作。
- Gemini Robotics On-Device 2:最高效的 VLA,为在机器人设备上本地运行而优化,能在数小时的数据内快速适配到全新的机器人本体。
全身控制。文章指出世界是为人类的运动方式建造的,需要伸手、弯腰、在拥挤狭窄的空间里保持平衡。此前的模型只能控制人形机器人的上半身来完成桌面任务,Gemini Robotics 2 首次把物理 AI 扩展到全身运动。以 Apptronik 的 Apollo 2 人形机器人为例,可以对它说「把喷壶放到底层架子上的绿色箱子里」,Apollo 会理解指令、走到桌边、拿起喷壶、走几步到架子前并精确放置。文章诚实地承认机器人在移动速度上仍有很多需要推进的地方。
灵巧度。模型现在能控制 Apollo 2 上五指、22 自由度的 SharpaWave 手完成打结、密封拉链袋这类精细动作,也能操作 Franka Duo 平台上标准的两指平行夹爪完成紧密打包等复杂任务。文章配的性能图表显示,同一个模型检查点被用于三种不同本体(配 SharpaWave 手的 Apollo 2、配 Inspire 手的 Apollo 2、配 Robotiq 夹爪的 Franka Duo),在全身和基于夹爪的灵巧任务上达到中到高的成功率,但多指灵巧操作仍然困难。
智能体推理与多机器人协作。ER 2 充当机器人的高层大脑,处理用户指令、与人沟通、观察房间、推理完成任务所需的步骤、与 VLA 协调执行动作并跟踪进度直到完成。这让机器人能执行复杂的多步任务、在某一步失败时自我纠正、并泛化到新情境和新目标。本次更新让机器人能更可靠地执行持续数分钟、涉及数百个决策的更长任务序列;ER 2 现在能理解任务何时开始和结束,并精确定位关键事件发生的时刻。多机器人协作则让不同类型的机器人能相互通信、共同解决单个机器人无法完成的复杂工作流。
端侧适配。On-Device 2 天生支持多本体,继承了 Gemini Robotics 1.5 的「运动迁移」技术,现在可以在数小时的适配时间、通常少于 200 个示例的条件下适配新的双臂本体——即便新本体在形状、传感器和自由度上差异巨大,文章以 Dexmate、SO101 和 Trossen 三个平台上的多样化任务作为演示。
安全。文章介绍了新的 ASIMOV-Agentic 基准,用于评估智能体式的安全编排与不确定性消解,例如衡量具身推理智能体拒绝来自 VLA 的不安全工具调用的能力,以及预测任务是否可行、在不确定时主动请求人类介入的能力。得益于增强的具身推理,ER 2 是他们迄今在安全约束遵循和人体接近度基准上表现最安全的机器人模型,能更好地检测附近有人、触发安全工具调用并在有人靠得太近时让机器人安全停止——这是协作安全标准的关键要求。
ER 2 现已在 Google AI Studio 上线,并在 Gemini Enterprise Agent Platform 上提供私有预览;VLA 和端侧模型面向早期合作伙伴开放。
HN 评论精华
这个帖子拿到 620 分、538 条评论,是本期讨论量最大的一篇。讨论集中在三块:这项技术到底走到哪一步了、人形形态是不是个伪命题、以及机器人普及后的劳动与分配问题。
从业者的真实评估
-
aabhay 提出了整个帖子最有价值的一个问题:有没有做这行的人能诚实地评估技术的真实状态?需要多少工装(instrumentation),交互质量如何,人形机器人在开门把手、跌倒后恢复、避免撞到东西这些日常任务上到底有多困难?
-
adityashankar 以本科论文做 VLA 的背景给出了细致的回答:还远远达不到实用。他指出施工场景里很多部件和结构根本没有准确的名称,机器人不太可能理解「把这个盒子左边那块放到右边那块上」这种人类能理解的模糊表达。更严重的是可靠的准确性测试数据几乎不存在——多数测试只跑几个演示,而 libero 这类流行基准已经饱和,几乎所有方法都能拿 95%,于是各家公司和研究者都用自己的基准。他还直言「公司撒谎很多」,视频里做的很多事非常危险,这些机器人本不该站在离人这么近的地方。他认为拧门把手是容易的,失败恢复也在做,但缺乏可靠统计;难的是实用场景,比如砌砖或装配零件时必须确保一切对齐。他强调把人形机器人放在家里非常不负责任(人是不受训练的),仅割草机每年就造成约 6400 人受伤,而那还不是万能机器。他的判断是:人形机器人因为关节维护和复杂性并不吸引人,反倒是装在轮子上的机械臂(参考 mobile aloha)更有可能承担酒店退房后的清理,或者在工作足够一致的情况下替代部分厨师。
-
probablyabot 以机器人技术员的第一手身份补充:他见过许多这些机器人的实地评估,各家在多种任务的训练上投入了惊人的精力和金钱,效果越来越好,但别指望这一代机器人短期内(甚至可能永远不会)在公共场合工作;总体上它们相当安全,但离能卖给个人用于家庭环境还很远。他预期未来几年会有惊人的进展。
-
tamimio 的评价最不客气:机器人行业有大量的猴戏,很多演示是为那个特定演示精心编排的,很多时候甚至存在实打实的欺诈(宣称自主实际却是遥操作);那些造成最大声量的机器人(机器狗、四足无人车)实际上没什么用,无论他们怎么编造用例。他认为机器人作为一个行业本身就很小众,唯一的例外是无人机——他在 2020 年的一次工作坊上就说过,只要解决续航问题,无人机会是唯一有潜力并将占据主导的方向,也正因为有用所以立刻被武器化了。他还留下一个冷知识:几乎所有四足无人车都不能在楼梯上倒退。
-
utopiah 提出了他认为的真正检验标准:任何一家卖(或计划卖)家用机器人即服务的创业公司,能不能不只是用上,而是获得回头客。他引用 Rodney Brooks 那篇《为什么今天的人形机器人学不会灵巧》,指出灵巧同时也是硬件问题——夹爪不是手;DeepMind 自己也承认「多指灵巧操作仍然困难」,而这些甚至还不是带大量传感器的手指。
-
YeGoblynQueenne 就叠衣服机器人给出了本帖最深入的技术批评。当 dyauspitr 引用 Sunday Robotics 宣称 99% 正确率的叠衣视频时,她指出:难以理解这一点是因为,你看一个人叠 T 恤,就能可靠地预测同一个人能同样好地叠另一件 T 恤、乃至各种别的衣物;机器人不是这样——你看到的就是你能得到的全部,看到某个机器人叠某件 T 恤,只意味着那个机器人能叠那件 T 恤。她引用《纽约客》关于 Google Mobile ALOHA 的报道,里面记者请求让刚刚系好鞋带的机器人试试自己的鞋,研究员的回应是「先说明期望:这被认为是不可能的任务」,机械爪戳了几下抓不住鞋带,最后被踩下失败踏板。对于 ACT-2,她的分析是:他们只宣传「9 种衣物类型」是个大提示,并且没有说明评估用的衣物是否在训练集内——从他们视频里能看出机器人是在完全相同的表面上、对完全相同的衣物、精确复制人类的折法,这正是模仿学习/RL 训练方式的固有限制:学的是像素集合到动作的映射,部署时如果输入像素与训练时显著不同,就找不到对应的策略。她还指出宣传「后训练提升泛化」的那段视频里,前景那台机器人叠灰色带白花的 T 恤时视频在完成折叠前就停了,而另一侧成功的机器人则展示了完整序列。她的收尾很克制:看这类视频时她总提醒自己,这是为吸引投资而做的技术演示,而她从波士顿动力的机器狗和 Atlas 后空翻一路看过来,state of the art 其实没怎么动过。
「苦涩的教训」之争
-
anonymid 向 DeepMind 研究员真诚提问:你们怎么应对 Rodney Brooks 那篇博客提出的根本问题——机器人相比人类粗糙得多的触觉与本体感觉,以及多感官、感知-动作耦合训练数据的稀缺?nl 回应说这篇博客像是没有消化「苦涩的教训」的人写的,并举证:连没有正经手指的 LeRobot 现在都能叠衣服了;各家实验室正在花巨资采集多感官、感知-动作耦合的训练数据(比如纽约那家用免费保洁换取保洁员视角视频的公司)。
-
由此爆发了本帖最长、火药味最重的一场辩论。jhanschoo 用自动驾驶做反例:为了做到今天这一步花了多少资本和时间,而最终我们偏好的平台仍然带着昂贵的 LiDAR。AndrewKemendo 回应说他前一晚坐 Waymo 跑了 12 英里,在开放环境里动态躲避行人和障碍物,体验比同晚坐的两趟 Uber 好多倍,问对方到底在看空什么。jhanschoo 澄清自己不是在唱衰今天的自动驾驶,而是在谈我们如何走到这一步,并逐步把立场表述清楚:他不否认我们正处在「苦涩教训」的范式里,也认为把人形平台作为基础能推动很多进展;他真正的疑问是,以今天的硬件,这个平台是否足以在我们期望的家务领域达到人类水平——他的立场比博客作者的「今天的人形机器人学不会」要弱,是「我们还说不准今天的人形机器人能不能学会」,但同样反对「苦涩教训意味着今天的人形机器人一定能学会」这个论点。ACCount37 反驳说 Tesla 整个车队跑的都是纯摄像头(包括无人 Robotaxi),Waymo 跑的是厚重的传感器栈,两者都能工作,说明传感器不是自动驾驶性能的分水岭,真正让自动驾驶可解的是 AI 的进展。nl 则给出了一个反转的读法:使用 LiDAR 恰恰是苦涩教训的完美例证——更多数据带来更好结果。
-
qsera 从另一个角度发起了一场持续二十多层的拉锯,主张 Action LLM 本质上还是在生成文本、由更高层软件解释后执行,所以帮助有限;如果映射是静态的就丢掉了用 AI 的全部优势,而对具备人类级灵巧度的硬件而言这个「物理词汇表」几乎是无限的。ACCount37 逐条反驳:现代 VLA 架构有专用的动作扩散头,工作在独立的非文本动作空间;即便真的只能输出文本,你也得先证明它们根本无法输出映射到有用动作序列的文本,而这毫无证据。他最终甩出了论文链接(π 系列的几篇),指出那里的扩散式「动作专家」与预训练 VLM 处在同一个注意力系统中,而 VLM 本身在训练配方里也被训练生成原始动作,只是推理时不这么做。qsera 到最后把主张收缩到了「没有足够数据来训练有用的机器人 LLM」,ACCount37 指出这个 VLA 的骨干本身就是一个预训练的(而且很小的)Gemma 模型,「你在看着一个用全互联网数据预训练、之后才被复用于机器人的 LLM 说这句话」。YeGoblynQueenne 在旁边插了一句冷水:苦涩的教训已经变成了一句无意义的行话,似乎很少有人真读过 Sutton 2019 年的原文,更少有人知道他后来对当前 AI 潮流的看法(她附上了「硅谷不理解苦涩的教训」的视频链接)。
-
cowboy_henk 引用图表指出「拧灯泡」的成功率只有 36%,认为这多少支持了 LeCun 关于 VLM/VLA 不会成为明天机器人动力的判断。LarsDu88 惊讶于拧灯泡居然低于系袋子和封拉链袋。heaney-555 反驳说这只是早期,18 个月前 LLM 在很多基准上也只有 36%,现在是 100%。
人形形态之争
-
prima-facie 提出很多家务任务根本不需要人形机器人:扫地机器人能扫地,垃圾处理可以集成进房屋,杂货配送和存储可以做成自动化的入库、编目和存储系统;人形机器人只是让人发毛,而且你没法真的信任它们——你能安心睡在有一台人形机器人的家里吗?如果你反对它创造者的政治立场呢?heaney-555 回应说这对已建成的公寓楼、联排住宅乃至多数半独立住宅完全是死路,只对新建独栋是个有趣但昂贵的方案;人形之所以是有用的形态,恰恰因为已经建成的人类世界按定义就是为人形设计的。prima-facie 进一步说明了他真正的担忧:通用人形机器人比扫地机这类专用机器人更容易被用于不良目的,极端情况下一台人形机器人可以执行民事逮捕、或者把你困在家里直到警察赶到;归根结底是两个问题——我们想不想被机器统治,我们想不想把自由交给企业的心血来潮。xgulfie 用一句话总结了同一立场:说到底我不应该需要信任我的机器人;扫地机或洗碗机就算发疯也夹不掉我的手指,它们物理上就没法听我说话或监视我,这些是好机器人。
-
rstuart4133 把这个论点推得更远:灵长类的身体形态也许对树上生活是最优的,但对我们希望机器人做的任何工业或家务任务都不是;全世界有数百万台机器人在做有用的事,从吸尘到组装 iPhone 到打乒乓球,没有一台长得像人。「如果一篇文章的主角是人形机器人,那它十有八九是公关软文。这一篇看起来是招聘广告。」
-
Chabsff 给出了商业侧的解释:人形机器人可以直接投放到当前使用人类劳动力的任何地方,这让它们极易卖给工业界,原则上能解锁那些因为「重新设计产线的 ROI 划不来」而仍依赖人力的自动化市场;他还补充说这不是梦想,而是玩世不恭的市场逻辑——自动化推进了很久,容易改造的低垂果实早就摘完了,这些机器人的角色是去处理那些「本来早该被自动化、只是做不到」的部分。poilcn 泼冷水:这些人形机器人造价 1 万到 10 万美元、维护昂贵,只为了做穷国里一美元就有人做的工作;他认为更现实的是 LLM 在未来几年大幅降低自动化成本、让更多行业用得起。numpad0 提醒说 ABB、EPSON、FANUC、川崎这些公司的机器人过去五六十年一直参与汽车装配,有些产品已经支持标准的人形/机器狗工具,「人形创业公司的高管就是不提这些」。
-
RandomLensman 抓住了官方文案里的一个矛盾:如果机器人在人靠近时会停止,那么用于近距离交互或照护人类的机器人岂不是需要完全另一个层级的控制?FartyMcFarter 确认这是另一个数量级的安全难题,officialchicken 补充说「更好」这个词承担了很重的工作量,意味着它仍在经常失败。
劳动、分配与家庭机器人的现实
-
logankeenan 提出了本帖被讨论最多的宏观论断:今天人类把劳动转化为资本,资本持有者需要劳动(人)来获取更多资本;当这些机器人的推理成本低于劳动力价格时,资本持有者就不再需要劳动了。ausbah 只回了三个字:这是好事吗?wffurr 说对资本持有者是好事,同时质疑「人形机器人近在眼前」的前提,怀疑它会像自动驾驶一样是个漫长的慢燃。dragonwriter 给出了最平衡的表述:接受这个终局的话,如果资本被有效民主化,这非常好;如果它仍然高度集中在一个狭窄阶层手里,那就是灾难性的。wartywhoa23 追问有没有任何迹象表明前者在我们的世界里可能发生,93po 回应说历史上曾有过民众成功推出断头台、对中央权力做出真正改变的时刻,wartywhoa23 则指出那是一个还能秘密组织和协调反对派的时代,而不是今天这种 7×24 小时实时监控的全景敞视。andsoitis 说「如果一切顺利,想象一个你因为想工作而工作、而非不得不工作的世界」,georgemcbay 接了下半句:「如果一切不顺,想象一个你和家人无家可归、活活饿死的世界。幸好今天负责把我们导向其中一个结局的政客和商业领袖都是房间里的成年人、非常有道德、四平八稳、一点也不腐败。所以……我们应该没事!」RandomLensman 还补充了一个技术性提醒:这不只是推理成本问题,在现实世界里处理物体和生命的错误有着与非物质应用完全不同的「面」,机器人可能需要故障保护和独立限位装置。
-
关于「家里到底要不要机器人」,RandomLensman 抛出的一个真诚提问(为什么宁愿和机器人打交道也不愿和人打交道)引出了本帖最长也最有人情味的一片讨论。支持机器人的理由包括:不用「预打扫」以免显得像个不体贴的邋遢鬼(CamperBob2);不用担心东西被拿起来放错地方;清扫可以随时启动或推迟而不依赖别人的日程;不想让不熟悉的人在自己空间里走动(Marha01、FartyMcFarter);以及「不用穿衣服」这个半开玩笑的理由。RandomLensman 的反驳一以贯之:你同样要管理机器(尤其是软件更新带来的行为变化),而在他的经验里管理人比管理机器容易;机器只是以不同的方式不可预测。lukan 补充了一个具体的担忧:如果机器人最终由 Musk 或 Altman 控制呢——正因如此,DeepMind 说「这种深刻的智能也能在设备上本地运行」才让他觉得有意思。kibwen 给出了最尖锐的一句:在人形机器人的场景里,你得到的是一台内置麦克风和摄像头、把你空间里每个私密细节传给出价最高者的监控设备;你不是让一个不太熟的人进入你的空间,而是让数千人进来。garbageman 顺着 leasing 的讨论补了一刀:「租赁过时了,锁定式订阅才是现在时。」
-
qurren 给出了本帖最清晰的经济学分析:对企业而言采纳门槛很低——如果这东西能一天工作 24 小时顶三个班次,名义上只要低于三份人类薪水、按一年预算周期算就划得来,这个数字很高、大概不难达到;但对家庭而言门槛完全不同,你很难说服多数美国家庭购买任何超过 1000 美元的东西。heaney-555 说会像买车一样通过分期或租赁,qurren 反驳说车在美国是绝对必需品(除了少数有像样公交的城市),机器人不是,标价几万块的话大多数人会自己拖地洗衣服。georgemcbay 补充了一层价值判断:无论成本如何,如果他要花钱不自己做这些事,他宁愿付给人——他知道外面有人需要这份工作,而他对这些人的重视程度远高于让 Google 和其他企业赚更多钱去卖未来的电子垃圾。jaccola 则从相反方向支持人形:扫地机器人只能扫 80-90% 的地板,且不如真吸尘器;家里有狗到处丢玩具,算上清路、倒尘盒,实际可能只完成 60% 的活;想做到 100% 你基本就需要一整个人形。
-
henpa 作为 47 岁无子女的人说他期待老年时有机器人照顾自己,sib 说自己 50 多岁、母亲 80 多岁,这项技术现在就极其有用,很多朋友处境相同。wartywhoa23 强烈反对,认为雇个机器人照顾年迈父母「是些令人不安的玩意」,并质问「你父母给你洗澡换尿布,你为什么不能?还是他们当年也雇了个机器人?」philipkglass 用一个具体案例回应:他有个患帕金森的叔叔,照顾他的女儿身材娇小,而叔叔身高体重约 200 磅——她根本没有力气在他跌倒后把他扶起来,只能叫急救。Gareth321 补充说这份理想主义需要一大剂现实:需要照护的老人不总能按时间表安排洗澡,他们会弄脏自己、绊倒、饿了渴了、要拿书和眼镜、要收信、会迷路和困惑,这可能是一份全职工作;把奶奶丢进养老院不再探望是坏的,为了当全职照护者而放弃家庭和工作也是坏的。fipar 则贡献了整段讨论里最动人的一条:他在祖母中风后亲自照顾她,即便有机器人他也不会把这件事外包——那不好受,但生活不必事事都好受;对他重要的是让她感到被爱和有尊严,这也是他在等救护车的那个夜晚为她梳头的原因(哪怕她当时已经尿在了地上),因为她一直说万一有急事一定要打理好头发,「考虑到中风有多糟,至少她能因为我一直在听而得到些许安慰」。
其他
-
canyon289 以「参与了这些模型的 DeepMind 研究员」身份现身,说 DeepMind 是极好的工作场所,是少数几个能让你在前沿大模型(Gemini)、前沿开放模型(Gemma)、机器人、科学(气象、生物等)以及任何与智能相关的主题之间流动的实验室。他最初写的是「唯一」,被 jauntywundrkind 挑刺说 Allen Institute for AI 覆盖了大部分领域(并列举了 MolmoBot、MolmoSpaces、MolmoAct 等具身 AI 工作),canyon289 大方地改了措辞并感谢挑刺。Razengan 向他提出了非嘲讽的严肃提问:你们在做什么来防止政府、企业和军队的滥用?这项技术有多少会惠及普通人,又有多少会用于加强监控和控制?CaptWorld 反问为什么要问员工这种他们无法决定的事,Razengan 回敬「『我只是执行命令』正是人类历史上一些最糟糕的事情发生的方式」,drusepth 出来调停说 CaptWorld 的意思不是不该问,而是好奇为什么要问——因为你多半得不到回答,就算有也是经 PR 过滤的非回答。
-
horacemorace 希望这能激励某个中国实验室发布权重让大家受益,martythemaniak 指出已经有了(Qwen 的 robotsuite,以及 Nvidia 的 Cosmos 系列),但 samhclark 说他找不到 robotsuite 的权重在哪。
-
xnx 感慨在 Anthropic 和 OpenAI 占据 80% 注意力的当下,Google 做的事情之多令人印象深刻:接近前沿的模型、快速模型、开放权重模型、图像生成、视频生成、音乐生成、机器人。
-
fernly 提到旧金山有公司在打广告提供人形机器人保洁服务,但那些机器人需要本地监督和一个通过视频画面操作的人类控制员。Geee 说他基本已经对人形机器人放弃了,因为执行器太差——自本田 ASIMO 以来机器人执行器几乎没有创新,没人会想要一个 80 公斤的摇摇晃晃的铁罐子在家里或工作场所晃悠。YuechenLi 提出跑完整 LLM 来驱动机器人太重,即便用强力 GPU 延迟也可能有 1-2 秒,对实际机器人应用不够用。WarmWash 给出了一个简洁的安全洞见:家用机器人最大的坎在于,如果它强壮到能帮你装空调,它也就强壮到能打断你的肋骨。xchip 吐槽视频剪辑点太多,像那种演员不会打架的功夫片。最后 freakynit 留下一个所有人都还没有答案的问题:这类机器人的「幻觉」等价物会是什么样子?