宇树智元共用一个大脑!神秘模型Demo炸场,10分钟一镜到底

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
宇树智元共用一个大脑!神秘模型Demo炸场,10分钟一镜到底
9842点击    2026-08-26 15:03

现在的具身智能公司,把Demo演示片拍得像广告一样精良和夸张,但一刀未剪的真实视频,你看过吗?


宇树智元共用一个大脑!神秘模型Demo炸场,10分钟一镜到底


前几天,有业内朋友给我发来一条10分钟的Demo,全程一镜到底,无剪辑,无场外遥控,无人工指令,甚至有些粗糙,但呈现的内容却让我直接瘫坐,心情久久不能平静(doge)


视频中,机器人会把手臂伸出窗外擦窗户,够不到高处时知道自己搬箱子踩在上面,长程任务中途被打断还能精准恢复……


更炸的是,视频中同时出现了宇树和智元的机器人本体,这两款硬件架构、运动自由度、传感系统完全迥异的“竞品”,同用一个“大脑”,互相配合,密切协作,是全球罕见的跨本体通用大脑样本。


宇树智元共用一个大脑!神秘模型Demo炸场,10分钟一镜到底

10分钟一镜到底视频Demo经1.5倍加速处理


不夸张地讲,它可能是一条足以改写全球具身智能行业认知、颠覆赛道技术判断的Demo,甚至可能改变了Scaling Law……


这到底是哪里来的神仙?


视频逐帧拆解,全是名场面


这条视频的信息量实在太大了。我认真地逐帧拆解,结果越看越上头。


  • 密闭空间作业,稳得离谱


拍摄场地是个15m²左右的出租屋,家具密集,过道狭窄,连转身都费劲。这种环境,基本没有遥操作(没办法站下人)和预设脚本的可能性。


宇树智元共用一个大脑!神秘模型Demo炸场,10分钟一镜到底


这个视频从环境的设计,就怼脸告诉大家,这只能是一条机器人完全自主学习、自主进化、自主决策的视频。


两个机器人在同一个空间里并行干家务活,实时感知边界、规划路径。


全程无碰撞、无迷路、无停滞,完美适配陌生复杂实景环境,就连被牵引绳拴着的战损版机器人都表现出了极强的灵活性。


整段视频没有切镜,没有重拍,也没有人工指令介入。


  • 伸手出窗擦玻璃,动力学能力与自主推理的巅峰具象


从第一个任务起,机器人就展现了“细腻”且超出人类想象的一面。


一台宇树机器人用刮水器擦玻璃,用过刮水器的人都知道,如果力使轻了擦不到,使重了又会出现异响,比拿抹布擦玻璃更考验力度控制和空间感知,上来就给自己加到地狱难度。


只见机器人擦了几下,有一处没擦干净,它居然自己会判断:脏东西可能在外面。


于是它做出了一套我从没看过的动作:侧身、后仰、探头、展臂,把拿着刮水器的手伸出了窗外。(稳如老狗)


宇树智元共用一个大脑!神秘模型Demo炸场,10分钟一镜到底

视频经1.5倍加速处理


一些现有的具身模型,能够把力控做好已经是极限,而这个机器人,却在精确地力矩控制的基础之上,天衣无缝地融合了对于空间环境的感知(伸出手并没有撞到窗框)和动力学的解算。


不仅单一能力做到行业天花板,模型还展现了三位一体的统一化表现。


更让我久久无法平复的是,在没有办法擦干净的情况下,它立即推理决策,将手伸出窗外擦玻璃,这是我第一次看到了模型像人一样的一次自我推理、自我进化。


这充分体现了模型把视觉、触觉、动力学等融合为统一感知,并且具备了自我进化的能力,这一次,我终于相信机器人真的能干活了,而且,将会干到比人更完美。


  • 长时序任务闭环,拒绝误差累积


擦完玻璃,宇树机器人平稳地把刮水器放回原位,落点精准,动作连贯。


别小看这个收尾动作,这意味着它完成了“取工具-作业-收纳”的全流程闭环。


身旁的智元机器人,走近洗衣机,拿出洗干净的坐垫放到沙发后,又返回继续拿出洗干净的娃娃,精准放进了二层衣柜,每件物品都回到了它们应该在的地方。


宇树智元共用一个大脑!神秘模型Demo炸场,10分钟一镜到底

视频经1.5倍加速处理


智元机器人不小心撞到了玻璃,更说明了这是机器人的自主决策,因为摄像头有时解决不了玻璃的反光,而如果人遥操的话可以(doge)


宇树智元共用一个大脑!神秘模型Demo炸场,10分钟一镜到底


这两幕是整个10分钟视频最基础能力的缩影,在长时序任务中,每一个任务都完成得丝滑、精准且一步到位,并不会因为任务变多、变长而累计误差,越做越差。


这解决了传统VLA模型最怕长序列任务的弊病。


单从动作表现来说,模型一定用了一套全新的架构,在10分钟的超长任务链里,持续纠错、稳定输出,每一个动作都做到精准可控,鲁棒性堪称行业顶尖。


  • 任务可随意打断,模型能做到断点续做


接下来,画面里出现了一声闹钟的铃声。(放大声音仔细听,不明显)


一开始我没有理解闹钟的意图,反复观看后发现,闹钟是某种设定好的提醒,会中断两位机器人当下的任务,开始执行收纳桌面跟冰箱的特别任务。


宇树智元共用一个大脑!神秘模型Demo炸场,10分钟一镜到底

视频经1.5倍加速处理


奇妙的是,收纳完桌面和冰箱后,机器人继续恢复执行被打断前的任务,这表现出模型具备随时打断、断点续做、任务恢复的能力。


对比市面上一次Demo只能完成一项任务,还得小心呵护,这个粗糙的视频展现出的是机器人在真实作业环境中,不仅耐用、甚至能“一心二用”的超强能力。


接下来是一整套居家收纳长流程:宇树机器人拿取收纳袋放到桌面,智元机器人看到冰箱上的食物,判断应该冷藏储存,就马上执行,并顺便拿出了应该解冻的食物(我猜这个神秘团队可能在暗示,机器人快可以做四菜一汤了)


宇树智元共用一个大脑!神秘模型Demo炸场,10分钟一镜到底

视频经1.5倍加速处理


全程没有分步指令,机器人自主拆解任务、规划动作,一步步完成从取物到归置的全流程。


如今绝大多数机器人只能执行单任务串行流程,中途遇到干扰,任务基本就崩盘了。而这套模型拥有人类级别的任务优先级判断和动态调度能力,可随时切换任务流,这种灵活性跟稳定性所展现出的智能,远超市面上任何一款已知模型的能力。


  • 智元给宇树戴围巾,跨本体协作名场面


随后,整条视频的最高潮出现了。


两个机器人仿佛商量好了,哥俩一定要一次整理好桌面上的杂物,不能来回搬运。


所以宇树不断往自己的身上放置物体,直到双手占满不知该如何操作了。这时,智元机器人温柔地走近,将桌上的一条围巾缓缓拿起,挂在了宇树机器人的脖子上。


智元机器人发现围巾很长,于是用双手捧起了围巾,这时宇树仿佛也看懂了智元的意思,弯下了腰,智元将围巾绕过宇树的头,挂在了对方的脖子上。


宇树智元共用一个大脑!神秘模型Demo炸场,10分钟一镜到底

视频经1.5倍加速处理


不是吧哥们?!这丝滑感以及彼此眼神的交互,怎么还有股CP感!


视频不是提前设定好的分工,而是模型在跨本体的两个机器人间,自主探索出的协作方案。两个不同品牌的机器人,自主判断各自的能力边界,并完美互补,这已经无限趋近人类的协作,甚至在没有语言的情况下,显得更加默契。


这可能是世界上第一次跨本体的交互,也可能是世界上第一次出现了能够通用本体的模型。


我猜这个神秘团队是想用两个互为竞品的本体告诉大家,这才是真正的通用大脑。


  • 搭毛巾、拎拖鞋,难道机器人不仅会干活,还已经开始“偷懒”了?


挂着一身物品的宇树缓缓走向远方后,智元继续收纳剩余的物品。


这时,它拿起一条毛巾,企图把它挂在自己身上。尝试了一次、两次、三次,终于挂在了自己肩头。


震惊三连!


机器人好像知道怎么最省劲,毛巾挂肩膀上,比拿在手上更省劲。


模型能自主学习,在一次两次没成功之后,不断优化直到成功。


模型能了解自己的本体,可能是它能够跨本体应用的核心原因。


宇树智元共用一个大脑!神秘模型Demo炸场,10分钟一镜到底

视频经1.5倍加速处理


这并不是孤例。


仔细看,机器人整理拖鞋时,它拎的是新拖鞋的挂绳而不是鞋体本身,因为拎绳子更省劲。


又一次震惊!在其他机器人还在为干活而精心打扮的时候,这个模型居然不光把活干了,甚至直接学会“偷懒”了?这真是太聪明了。


  • 又一次高潮,机器人学会使用工具,企图用箱子垫高自己


还没结束,最让我震惊的一幕出现了,在将挂满全身的物品一一归位的过程中,如何把围巾放到第三层柜子,难倒了身高只有1.3米的宇树G1机器人。


神性的一幕出现了!它没有卡住,也没有放弃,而是像人推理一样,自己找了个箱子!对的,找了个箱子!企图站在箱子上垫高自己再试一试。


只见它找到了旁边的箱子,并一把把它推到了地上,企图弯腰搬箱子,却发现自己弯不下腰。


尝试了几次后,就当我以为它总该要放弃了的时候,它惊世骇俗地一脚把箱子踹到了柜子边!


宇树智元共用一个大脑!神秘模型Demo炸场,10分钟一镜到底

视频经1.5倍加速处理


整个过程体现了:


自我推理跟决策的能力。机器人懂得怎么能让自己够到高处的物体,怎么能在弯不下腰的情况下挪动箱子。


模型对身体能力的不断探索。在一次次弯腰尝试的过程中,机器人仿佛越来越了解自己的身体边界,也做出了匹配身体能力的选择。


自我进化的过程。机器人在没有任何教学的过程下,居然学会了用脚来踢箱子,善于利用自己的身体在环境中自我进化。


这一幕,真的让我后背发凉。


要知道,能自主使用工具,可是人类的标志性体现。


而视频中的机器人居然真的学会了使用工具。它知道箱子可以承重,知道站上去能增加高度,甚至知道弯不下腰时可以用脚踢。


这套动作背后,是对物理世界规则的深度理解、对自我能力的不断探索、跟自我决策进化的三者合一。


  • 跨本体能力互补,协同作业,从个体到群体


宇树一脚将箱子踢过去,踢歪了,就在它思考如何将箱子回正的时候,身高1.7m的智元远征A3走了过来,它好像看出了宇树的执着和困境,放下了手里的小拉车(主动切换任务),选择去帮助同伴。


只见,像毕业授勋一样,宇树弯腰低头,智元缓缓地拿下了围巾,放到了架子上。


宇树智元共用一个大脑!神秘模型Demo炸场,10分钟一镜到底

视频经1.5倍加速处理


细节里的每一步,都体现了藐视其他模型的能力。


两个机器人对于自身以及彼此间硬件能力的了解和配合,跨越了个体智能,走向了群体智能。


智元将围巾绕过了宇树的脑后,才能轻巧地取下围巾(此处可以脑补其他机器人会如何拽下这条围巾),展示出对于力度控制和跟空间感知的极致理解。


机器人将围巾折了三折,是对于如何更好地把围巾放进衣柜的自主判断,这才是真正的具身“智能”。


最后,智元帮助完宇树后,默默离开,将最后一件衣服稳稳地放进了洗衣机(我猜它判断出了搭在洗衣机上的是脏衣服),这条十分钟的一镜到底终于结束了。


虽然我不知道这个模型的架构,但是我相信大家跟我一样已经惊呆了。


第一次跨本体协作、第一次看见机器人的自主进化、第一次类人的自主决策选择最优路径、极致的空间感知跟力控、任务随意打断、学会使用工具……这个模型的每一个动作、每一帧都是一个很好的Demo,但他们就这么静静地出现在这个十分钟一镜到底的视频里,而且呈现方式是这么简单直接。


仿佛是一种轻松随意、信手拈来就能做到的王者感。


底层技术跳出主流模型固有框架


为什么视频中的机器人能贡献这么多名场面?


我从知情人士那里了解到,最重要的原因是,这套模型跳出了当前主流具身模型的所有固有框架。


现阶段主流具身模型大概可以分为VLA、WAM和传统世界模型三类,它们都有暂时无法突破的瓶颈。


宇树智元共用一个大脑!神秘模型Demo炸场,10分钟一镜到底

图片由AI生成


具体来说,VLA是“数据直觉派”,依托海量视觉、语言、动作数据做端到端拟合。但它的本质是“看图猜动作”,缺失物理推理能力,长序列任务会持续累积误差,陌生场景泛化能力近乎为零,且高度绑定专属本体。


而WAM和传统世界模型是“预判空想派”,试图先建模世界规律再规划动作,但存在致命的“知行割裂”问题。模型能看懂场景、预判状态,但面对需要物理动力学推理的实操场景,依旧只能依赖训练数据推演,无法适配真实环境的动态变数。


这些主流具身模型存在共同的底层致命缺陷:数据驱动的任务拟合。


也就是说,所有动作都是基于海量数据的“概率猜测”,而非对物理规则的深度理解。这导致模型的能力上限被训练数据牢牢锁死。


而且据说,视频中的模型只用了几十个小时的视频数据训练。如此少的数据量就能达到这样惊人的效果,Scaling Law还存不存在?真的要打一个问号了。(美股大跌预告)


宇树智元共用一个大脑!神秘模型Demo炸场,10分钟一镜到底


从细节看,视频中的模型起码展现了现阶段VLA和世界模型无法企及的四个能力:


  • 动力学建模:轨迹满足动力学可行性,能计算补偿力矩和前馈项,外推泛化能力绝佳;
  • 自我认知能力:不像VLA靠条件反射,也不像WAM靠时序统计,它像人一样思考“下一步最接近目标的动作是什么”;
  • 自适应能力:能补足因果推理,解决长尾问题,边做边进化;
  • 自我进化能力:在完成任务的过程中,技能自增长,策略自进化,仿佛能自我驱动产生学习目标,并主动推理实现价值。


支撑这一切的,是三个底层技术内核。


物理约束动力学学习。区别于VLA、WAM纯数据驱动的训练模式,它的核心是物理规则前置、动力学预测驱动。拎拖鞋挂绳、肩搭毛巾、站箱子登高,都不是数据教的,是模型与环境交互自主探索出的最优解。


跨本体统一建模。通过统一的动作表示空间与本体自适应机制,让同一套模型适配不同品牌、不同架构的硬件平台。相当于为具身智能完成了“软硬件解耦”,终结了硬件绑定算法的时代。


长时序鲁棒闭环。依托全局任务调度框架,自主处理全程突发干扰、动作误差、任务切换,避免传统模型长流程误差累积崩盘的问题,具备真实家庭、复杂场景落地的核心能力。


宇树智元共用一个大脑!神秘模型Demo炸场,10分钟一镜到底


如果你了解具身模型的现状,看完以上内容之后,估计也会惊掉下巴。


当其他团队的Demo还在堆砌短时长、精修、单任务时,这个神秘视频已经完成了10分钟无修剪、跨品牌、多协同、全流程、自进化的真实实景落地。


当其他模型还在“靠数据猜动作”时,这套模型仿佛已经实现了完全的自我决策、自我学习、自我进化。让大家看到,机器人不仅真的可以干活,而且能力还在快速自我进化,给人无限的想象空间。


更重要的是,这个模型仿佛让我们看到,大家热火朝天在争论的是三年、五年、还是十年会到来的机器人真的能够替人干活的未来,今天就出现在了你的面前。


宇树智元共用一个大脑!神秘模型Demo炸场,10分钟一镜到底


一个不知道是哪里来的团队,仿佛颠覆了所有的技术路径,颠覆了Scaling Law,做出了真正的具身“智能”,逼近了具身智能的ChatGPT时刻。


目前还不知道这个神秘模型出自谁家,但我相信此刻,大家的疑问都跟我一样:到底是谁!!!


哪位大神有什么小道消息么!!!


文章来自于"量子位",作者 "诺亚"。

AI转型,免费服务,就找AITNT