刚刚,GPT-6 Astra接上宇树G1,把厨房收拾了!

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
刚刚,GPT-6 Astra接上宇树G1,把厨房收拾了!
9247点击    2026-09-29 11:15

机器人的GPT时刻,还真得靠GPT(doge)!


刚刚,GPT-6 Astra接上宇树G1,进厨房干活了~


在斯坦福团队的最新项目HomeBody中,宇树G1先探索一个从来没见过的厨房,随后就能根据语言指令,收拾物品、丢掉纸盒,甚至把不在眼前的药找出来,递到人手里。


刚刚,GPT-6 Astra接上宇树G1,把厨房收拾了!


比如,让它把咖啡袋集中放到中间,再丢掉指定的牛奶和橙汁纸盒。


刚刚,GPT-6 Astra接上宇树G1,把厨房收拾了!


G1就会在厨房里来回搬运,把咖啡袋归拢到岛台上,再处理要丢弃的纸盒。


再比如,一句「帮我把药拿来」。


刚刚,GPT-6 Astra接上宇树G1,把厨房收拾了!


即使药不在当前视野里,它也能从之前保存的画面中找到线索,走到对应抽屉前,打开抽屉、取出药,再递给人,期间还能把丢纸盒的任务一并完成。


可以说,从Robocurve此前让GPT和Claude控制机械臂,完成桌面抓放测试,到这次G1走进厨房,大模型控制机器人的任务范围,又往外扩了一圈。


这一次,机器人不只要判断眼前抓什么,还得记住东西在哪,再把走路、抓取、放置连成一串。


更值得注意的是,团队表示,部署到这个新厨房时,系统不需要额外采集训练数据,也无须再训练一套专用动作策略,泛化性是相当可以了。


看到这里,有人已经忍不住开始盘算了:


我要是有钱买台G1,再接上GPT,是不是也能……?


不过,也先别急着下单,事情还没简单到「买台机器人,登录GPT」这一步。


咱们先看看HomeBody究竟是怎么把活干起来的?


让GPT把机器人技能当工具调用


简单来说,HomeBody的核心思路可以概括为一句话:让GPT把机器人技能当工具调用。


Astra负责理解目标、安排步骤,再调用导航、抓取、开抽屉等技能,把任务一步步做完。


不过,要让机器人去厨房拿东西,先得让它知道:厨房长什么样,东西又放在哪里。


整个过程,可以分成三步。


Step 1,先逛一圈,把厨房记下来


在HomeBody中,机器人接到的第一条指令很简单,「你是一台厨房机器人,请探索这个空间」。


刚刚,GPT-6 Astra接上宇树G1,把厨房收拾了!


随后,Astra会选择值得观察的位置,引导G1移动。机器人一边走,一边记录相机画面、激光雷达扫描,以及自身的关节姿态和途经位置。


相机负责看清房间里有什么,激光雷达等传感器提供实测的空间结构;SLAM,也就是同步定位与建图,则帮助机器人一边建立地图,一边确定自己在哪。


这些观察不会随着机器人转身就消失,而是会被保存下来,成为后续任务可以调用的空间记忆。


Step 2,把现实厨房搬进模拟器


逛完还不够,Astra接下来还要担任Real2Sim智能体,在Isaac Sim仿真平台里搭出一个数字厨房。


刚刚,GPT-6 Astra接上宇树G1,把厨房收拾了!


这个数字孪生相当于一份立体房间模型,帮助系统判断各处的位置,以及机器人与目标之间的空间关系。


为了让数字厨房不仅看起来像,HomeBody还会把SLAM测得的几何信息也交给模型,用真实测量约束重建结果。


毕竟,台面的位置、通道的宽度,都会影响机器人能不能走过去、手能不能伸到位。


随后,系统会把真实世界的定位地图与数字厨房对齐到同一个坐标系,再将拍到的画面、内容描述和对应位置关联起来。


这样一来,之前保存的画面就不只是「我见过这个抽屉」,还对应着一个可以返回的位置。


之后再找东西,机器人就能先从记忆里查线索,再走回对应地点。


Step 3,给个目标,让它自己安排动作


准备完成后,用户就可以说「收拾一下厨房」,再补充咖啡袋放哪里、哪些纸盒要扔。


刚刚,GPT-6 Astra接上宇树G1,把厨房收拾了!


Astra会结合当前画面、地图、空间记忆、手里有没有拿着东西,以及上一步的执行结果,选择接下来调用哪项技能、操作哪个目标。


前面展示的取药demo就用到了这种能力。用户虽然没说药在哪,但系统可以从保存的关键画面中找到抽屉,再把导航、开抽屉、取药等技能接起来。


GPT负责安排,身体到底谁来控制?


此前,Robocurve让GPT、Claude控制机械臂,是让模型根据相机画面和机器人状态,通过工具调用指定夹爪的位置、朝向和开合状态,再由底层模块转换成具体动作。


HomeBody同样采用工具调用,但交给GPT的是更完整的技能:导航、抓取、放置、开抽屉,以及从抽屉中取物。


要理解这两者的区别,咱们先看看机器人系统的一种常见分工:


  • System 2是视觉语言模型(VLM),负责看图、理解指令、决定做什么;
  • System 1是视觉语言动作模型(VLA),负责生成动作命令;
  • System 0则是底层控制器,负责协调身体执行。


刚刚,GPT-6 Astra接上宇树G1,把厨房收拾了!


简单说,就是「安排任务—生成动作—控制身体」。


而HomeBody调整的,正是中间这一环:让System 2直接调用技能库,由技能模块规划具体动作,再交给底层控制系统执行,不必经过一个学习型VLA。


具体来说,这些技能库里装的是已经写好、可复用的电机技能(Navigate、Pick、Place、Open drawer、Pick from drawer 等)。


这些技能有统一的接口:大模型只需要告诉它“去哪里、抓什么、放到哪”,技能自己执行,执行完再把结果反馈给大模型。


比如抓取,Astra只需要在画面中点出目标物体,再指定使用左手还是右手。


刚刚,GPT-6 Astra接上宇树G1,把厨房收拾了!


接下来,抓取技能内部的感知模块会圈出物体、估计深度,结合相机标定确定目标的三维位置,并计算抓取姿态。运动规划器再规划机械臂怎么伸过去、怎样避开障碍,最后交给控制模块执行。


换句话说,GPT决定抓哪个、用哪只手,技能模块解决手怎么伸过去、怎么抓起来。


其他技能也遵循类似的分工。导航接收目标位置和朝向;放置接收物品的落点;开抽屉则把对准把手、勾住把手、后退拉开,封装成一项完整技能。


刚刚,GPT-6 Astra接上宇树G1,把厨房收拾了!


每项技能执行后,都会把结果反馈给Astra,再由它决定下一步。遇到偏差时,技能模块会先自行调整、重试,解决不了再交回大模型重新安排。


通过这样的决策—执行—反馈循环,「走到抽屉前—打开抽屉—取出药」就能被串成一项任务,而不必让大模型包办每一步的运动细节。


至于走路、伸手时怎样保持平衡,则属于前面说的System 0的工作。HomeBody使用预训练的AMO控制策略,让下半身运动同时考虑上半身的动作目标,协调行走与操作。


这也解释了为什么,不需要额外训练,不等于整套系统从未训练过。HomeBody不用为新厨房重新训练一套专用动作策略,但现成的感知模型、运动规划和预训练控制器,仍然是机器人能把活干起来的基础。


不过,省去了针对新环境的训练,并不意味着部署和运行就没有成本。


目前,HomeBody的感知、规划和技能执行运行在一台搭载RTX 4090的笔记本上,Astra则在远端负责决策。


前期重建数字厨房,需要准备时间和API成本;实际执行任务时,模型推理也会让动作之间出现等待。


即使软件流程顺利跑通,长时间干活还得过硬件这一关,比如手指舵机过热,就是系统目前面临的限制之一。


所以,把GPT接上宇树机器人确实能让机器人进厨房干活,但背后还得有一整套感知、规划和控制系统配合。


至于现在就买台G1、接上GPT的API,坐等它帮你做家务——还没这么简单。


大模型控制机器人


自万恶之源Robocurve用GPT-6 Astra控制机器人开始,机器人/具身圈几乎一夜之间进入了“大模型时代”。


刚刚,GPT-6 Astra接上宇树G1,把厨房收拾了!


总的来看,目前主要有几条路线:


第一条是Robocurve最早采用的方案:大模型直接接收相机画面和机器人状态,输出夹爪的目标位置、朝向和开合程度,再由底层逆运动学模块转换成关节动作执行,完成后重新观察,形成闭环。


第二条路线是让大模型充当System 2(慢思考),搭配负责生成动作的VLA。Anthropic就测试过让语言模型接收、修改甚至替换MolmoAct提出的动作。


这次的HomeBody则选择让System 2直接调度技能库,再由包括预训练AMO在内的底层系统负责执行与身体协调。


它不是简单地「多接一层System 0」,而是换了一种连接决策与动作的方式,再结合空间记忆,把任务从桌面扩展到整个房间。


目前,Robocurve的最新战况是:最新的GPT-6 Sol平均得分是GPT-5.6 Sol的1.6倍,成本却低了约47%。


刚刚,GPT-6 Astra接上宇树G1,把厨房收拾了!


Opus 5.5的平均得分约为Opus 5的1.8倍,与GPT-6 Astra接近,单次成本比Astra低约21%。


刚刚,GPT-6 Astra接上宇树G1,把厨房收拾了!


参考链接

[1]https://tml.stanford.edu/homebody/

[2]https://x.com/chooi_jeq


文章来自于微信公众号 “量子位”,作者 “量子位”

AI转型,免费服务,就找AITNT
AITNT资源拓展
根据文章内容,系统为您匹配了更有价值的资源信息。内容由AI生成,仅供参考
1
AI代理

【开源免费】Browser-use 是一个用户AI代理直接可以控制浏览器的工具。它能够让AI 自动执行浏览器中的各种任务,如比较价格、添加购物车、回复各种社交媒体等。

项目地址:https://github.com/browser-use/browser-use


2
智能体

【开源免费】AutoGPT是一个允许用户创建和运行智能体的(AI Agents)项目。用户创建的智能体能够自动执行各种任务,从而让AI有步骤的去解决实际问题。

项目地址:https://github.com/Significant-Gravitas/AutoGPT


【开源免费】MetaGPT是一个“软件开发公司”的智能体项目,只需要输入一句话的老板需求,MetaGPT即可输出用户故事 / 竞品分析 / 需求 / 数据结构 / APIs / 文件等软件开发的相关内容。MetaGPT内置了各种AI角色,包括产品经理 / 架构师 / 项目经理 / 工程师,MetaGPT提供了一个精心调配的软件公司研发全过程的SOP。

项目地址:https://github.com/geekan/MetaGPT/blob/main/docs/README_CN.md