全行业都在卷大模型,他们却用不确定微分几何给机器人做了个大脑
全行业都在卷大模型,他们却用不确定微分几何给机器人做了个大脑7 月中旬的一天,清华科技园的一处办公区, 一台人形机器人站在屋子中央,身后没有风扇轰鸣的 GPU 机柜,不远处是两张落满公式的书写板。
搜索
7 月中旬的一天,清华科技园的一处办公区, 一台人形机器人站在屋子中央,身后没有风扇轰鸣的 GPU 机柜,不远处是两张落满公式的书写板。
天使轮由一线美元基金,智能制造与大模型产业方共同领投;数据集 Xperience-10M 位列全平台数据集榜第 2 名,具身赛道第一名,目前已被多款具身基础模型 Qwen-VLA、MolmoMotion 等采用;多模态采集系统 HOMIE 进入规模化量产交付,新一代系统将于 2026 年 8 月发布。
作为具身智能最主流的路线之一,VLA 快速发展的同时也因为其各种问题被诟病。其中最主要的痛点之一便是指令泛化能力。
「Optimus 会是一款史诗级(epic)产品。」
让机器人把一只虾夹起来,再放进锅里。
AI Pin凉了,Rabbit R1凉了,Lookie和Nuna吃灰率也很高。就算是Plaud,也还是23年底录音笔+AI总结的形态。
当下,一个逐渐清晰的共识是,具身智能的叙事正由「会不会做一个动作」,转向「能不能在真实世界里稳定完成复杂任务」。尤其是在刚刚过去的 WAIC2026 现场,这一点尤为明显,机器人不再满足于表演式的单动作演示,而是被期待走进产线、仓储和酒店客房,真正「做事」。
这是连马斯克都亲自盖章、公认最难啃的一块「硬骨头」。
2026 年 7 月 31 日,迪士尼公司公布了旗下加速器项目(Disney Accelerator)第 12 期名单,入选的 5 家公司都和 AI 密切相关,其中包括具身智能公司 FieldAI、Physical Intelligence(简称 PI),以及 3 家生成式 AI 公司。
多模态基础模型可以通过互联网规模的图像与语言学习「看」和「说」,但具身智能没有同样的捷径。机器人必须进一步理解物理状态与动力学,判断动作如何改变环境,并在真实世界中执行连续行为;这要求训练数据同时连接观察、状态、动作与物理后果。