谷歌:在LLM圈里我唯唯诺诺,在机器人圈里我直接大打出手!
刚刚,谷歌DeepMind发布了新一代的机器人大脑Gemini Robotics 2。
从官方放出的Demo来看,这一代模型不仅能听懂人类指令,还能控制机器人调动整个身体,完成移动、抓取和灵巧操作等一系列任务。

和以往各家具身demo集中展示的桌面操作不同,这一次,Gemini Robotics 2明显把战场从桌面扩大到了机器人的全身。
机器人不再只是站在原地伸手拿东西,而是要自己走到目标面前、调整身体姿态,再用双手乃至多指灵巧手完成精细操作。
与此同时,除了负责运动控制的Gemini Robotics 2,谷歌这次还一口气推出了另外两款模型,分别负责高级推理和端侧部署,直接凑齐三件套:
基于这套小连招,Gemini Robotics 2在全身操作、多指灵巧操作以及夹爪操作等任务上,都取得了相当不错的成绩。



By the way,在官方发布视频中,我们还发现了谭捷老师也全程亮相,并负责介绍这次工作。
他目前是Google DeepMind机器人团队的首席研究科学家、技术负责人,本科毕业于上海交通大学。

接下来,我们具体来看。
咱先从负责运动控制的Gemini Robotics 2说起。
如前所说,Gemini Robotics 2本质上仍然是一款VLA模型。它接收人类的语言指令和机器人摄像头捕捉到的视觉信息,再直接输出机器人的动作。

不过,这一代模型最大的变化,是开始把机器人的整个身体纳入统一控制,而不是上下半身的操作-移动解耦。
比如,当人类下达“把洒水器放进底层架子的绿色收纳箱里”这一指令后,Apollo需要先理解洒水器和绿色收纳箱分别在哪里,然后走向桌子、拿起洒水器,再移动到货架旁,弯下身体,将其准确放进指定位置。
这看上去只是一次简单的收纳任务,但背后涉及的其实是一整套连续的全身移动与操作:
机器人既要控制双腿行走和转向,也要调整躯干与手臂姿态,最后还要完成稳定抓取和精确放置。
换句话说,这一次的Gemini Robotics 2,不只是让机器人拥有了一双更灵巧的手,而是开始尝试把腿、腰、手臂和手指连成一个整体。
除了全身移动操作,官方展示的几个灵巧操作Demo也都相当惊艳。
比如,机器人可以拿起灯泡,将它旋出灯座,同时控制手指的力度,避免把灯泡捏碎。

它还可以双手协同,一只手拿着簸箕,另一只手拿着刷子,把桌面上的垃圾扫进去。

也可以将葡萄装进密封袋,再捏住袋口两端,把塑封条完整拉上。

还有一个操作更离谱:机器人会用一种人类看上去都相当别扭的指法,把塑料袋一点点撑开并套上去。

从Demo画面来看,这套系统似乎同时使用了头部的第一视角摄像头和腕部相机,让机器人既能观察整体环境,也能在接触物体时获得更近距离的视觉反馈。
当然,正如谷歌这次反复强调的,Gemini Robotics 2并不是只为某一台机器人定制的“大脑”。
同一套模型可以迁移到不同机器人本体和末端执行器上,继续完成相似的操作任务。

这也意味着,谷歌希望解决的不只是“让一台机器人学会一个动作”,而是让同一种能力能够在不同身体之间迁移。
最后,从Demo中我们也不难看出,谷歌DeepMind这次没有继续使用此前长期合作的波士顿动力机器人,而是把模型部署到了多套不同硬件上,包括Apptronik的Apollo 2人形机器人、拥有22个自由度的Sharpa灵巧手,以及由两台Franka机械臂组成的双臂平台。
除了负责运动控制的VLA模型,谷歌还推出了Gemini Robotics ER 2,作为整套系统里的“高级大脑”。
简单来说,如果Gemini Robotics 2负责“怎么动”,那么ER 2负责的就是“接下来做什么”。
它会理解用户指令、观察周围环境,将复杂任务拆成多个步骤,再调用VLA模型逐步执行,并持续跟踪任务进度。
这次更新后,ER 2已经能够更稳定地处理持续数分钟、涉及数百次决策的长序列任务。它不仅知道任务何时开始和结束,也能识别拿起物体、完成放置等关键事件。
如果中间某个步骤出现错误,机器人还可以重新观察环境、调整计划,再继续执行,而不是一次失败就直接停机。
此外,谷歌还展示了多机器人协作能力。

不同类型的机器人可以相互传递任务信息、分工完成同一套工作流,从而处理那些单台机器人难以独立完成的复杂任务。
换句话说,ER 2不直接负责控制机器人的每一个关节,而是站在更高层,负责规划任务、跟踪进度,以及调度不同的机器人身体。
最后是负责端侧部署的Gemini Robotics On-Device 2。
它是谷歌目前效率最高的VLA模型,可以直接在机器人本地运行,避免网络延迟,也能适应工厂、户外等无法稳定连接云端的场景。
更重要的是,它原生支持多种机器人本体。

借助从Gemini Robotics 1.5继承的“运动迁移”能力,On-Device 2通常只需要不到200个示例和几个小时的适配,就能迁移到一套新的双臂机器人上。
即使新机器人的外形、传感器和自由度差异很大,这套方法依然可以工作。
谷歌也在Dexmate、SO101和Trossen等不同平台上展示了这一能力。
整体来看,谷歌这次发布的三款模型分工相当明确:
ER 2负责理解和规划任务,Gemini Robotics 2负责把计划变成全身动作,而On-Device 2则负责将这些能力快速装进不同的机器人身体里。
目前, Gemini Robotics ER 2 现已在Google AI Studio上可用,同时也在 Gemini Enterprise Agent Platform 平台上提供私有预览版本。具体可参开发者博客。
参考链接
[1]https://deepmind.google/blog/gemini-robotics-2-brings-whole-body-intelligence-to-robots/
文章来自于"量子位",作者 "henry"。
【开源免费】字节工作流产品扣子两大核心业务:Coze Studio(扣子开发平台)和 Coze Loop(扣子罗盘)全面开源,而且采用的是 Apache 2.0 许可证,支持商用!
项目地址:https://github.com/coze-dev/coze-studio
【开源免费】n8n是一个可以自定义工作流的AI项目,它提供了200个工作节点来帮助用户实现工作流的编排。
项目地址:https://github.com/n8n-io/n8n
在线使用:https://n8n.io/(付费)
【开源免费】DB-GPT是一个AI原生数据应用开发框架,它提供开发多模型管理(SMMF)、Text2SQL效果优化、RAG框架以及优化、Multi-Agents框架协作、AWEL(智能体工作流编排)等多种技术能力,让围绕数据库构建大模型应用更简单、更方便。
项目地址:https://github.com/eosphoros-ai/DB-GPT?tab=readme-ov-file
【开源免费】VectorVein是一个不需要任何编程基础,任何人都能用的AI工作流编辑工具。你可以将复杂的工作分解成多个步骤,并通过VectorVein固定并让AI依次完成。VectorVein是字节coze的平替产品。
项目地址:https://github.com/AndersonBY/vector-vein?tab=readme-ov-file
在线使用:https://vectorvein.ai/(付费)
【开源免费】AutoGPT是一个允许用户创建和运行智能体的(AI Agents)项目。用户创建的智能体能够自动执行各种任务,从而让AI有步骤的去解决实际问题。
项目地址:https://github.com/Significant-Gravitas/AutoGPT
【开源免费】MetaGPT是一个“软件开发公司”的智能体项目,只需要输入一句话的老板需求,MetaGPT即可输出用户故事 / 竞品分析 / 需求 / 数据结构 / APIs / 文件等软件开发的相关内容。MetaGPT内置了各种AI角色,包括产品经理 / 架构师 / 项目经理 / 工程师,MetaGPT提供了一个精心调配的软件公司研发全过程的SOP。
项目地址:https://github.com/geekan/MetaGPT/blob/main/docs/README_CN.md