Physical Token经济学:下一项能力更便宜,机器人才能真正规模化

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
Physical Token经济学:下一项能力更便宜,机器人才能真正规模化
5635点击    2026-08-20 14:41

8 月 19 日,WRC 2026 期间,由跨维智能主办的「物理 AI 引领者论坛」在北京举行。


跨维智能创始人兼 CEO、香港中文大学(深圳)教授贾奎,智象未来创始人兼 CEO、加拿大工程院外籍院士梅涛,大晓机器人董事长、商汤科技联合创始人王晓刚,清华大学计算机系副研究员苏航,香港中文大学(深圳)— 深圳河套学院双聘助理教授刘桂良,以及来自地瓜机器人、临界点、智在无界等公司的算法和技术负责人齐聚现场。


从生成式世界模型、具身数据和基础模型,到跨本体学习、仿真训练和真实场景部署,论坛将物理 AI 领域的多条技术路线放在了同一个议程中。路线虽然不同,指向的问题却高度一致:物理 AI 如何从「理解世界」走向「完成任务」,又如何从少数成功的 Demo 走向可持续的规模化落地。


论坛现场,贾奎发表《Physical Token 经济学》主题演讲,从一笔「能力成本账」 切入,系统阐释了 Physical Token 概念,以及如何衡量可靠物理智能的生产成本。


Physical Token经济学:下一项能力更便宜,机器人才能真正规模化


6 月底,跨维智能宣布完成 10 亿元 B 轮融资,投后估值超过百亿元,加速物理 AI 赛道头部竞争。站在新的产业节点上,跨维和整个具身智能行业都需要面对一个问题:通往通用物理智能的路径,能否在经济上持续成立?


迈向通用物理智能,绕不开规模经济


通用物理智能的理想状态,是机器人进入陌生场景、面对新的物体和任务时,能够复用已有知识,只需少量适配,甚至不经额外训练就能完成任务。行业所说的 Generalist 和 Zero-shot,指向的都是这一方向。


难点不在于描绘终局,而在于如何走到那里。


与互联网上现成的文本、图片和视频不同,机器人需要的动作、接触、受力和失败经验,大多要在真实世界中通过交互获得。每一次采集和试错,都意味着设备、算力和工程人力的投入。


这让具身智能面临一个现实矛盾:没有足够丰富的物理经验,模型很难走向通用;但如果每进入一个新场景,都要重新采数、示教、训练和调试,机器人又很难实现规模化落地。


如果每学会一项新技能,都要投入近似相同的成本,那么机器人会做的事情再多,也只是项目数量的增加。要摆脱项目复制,已有的数据、模型和部署经验必须能够持续复用:一项任务产生的数据服务更多任务,部署中遇到的失败和长尾状态回流模型,模型增强后,下一个场景所需的数据、训练和人工随之减少。


这正是具身智能需要的规模经济 ——能力边界不断扩大,获得下一项能力的成本不断下降


从这个角度看,规模化不只是通用物理智能成熟后的结果,也可能是走向通用的必要路径。机器人先进入真实场景,在持续部署中积累经验、增强模型,再用更强的模型降低下一次部署的成本。


问题也随之从「机器人还能学会什么」,转向「让机器人学会下一项能力,还要投入多少人力、数据和算力」。


Physical Token 经济学试图衡量的,正是这笔账。


从「模型能做多少」

到「下一项能力还要花多少钱」


Physical Token 不是简单的动作 Token,也不意味着机器人未来一定要按照 Token 收费。


按照跨维给出的定义,Physical Token 是「物理智能体能够生产的单位可靠物理智能」。这套概念试图把机器人的智能生产能力,转化为一个可以计量和核算的对象。


Physical Token经济学:下一项能力更便宜,机器人才能真正规模化


因此,Physical Token 经济学关注的不是一次动作如何计价,而是:


以通用物理智能为目标,生产单位可靠物理智能,需要多少人力、数据和算力?


机器人完成一次抓取,可能只需要几秒钟。但要让这几秒钟在真实场景中稳定、连续地发生,背后往往要经过数据采集、模型训练和工程调试。动作本身只是结果,真正决定成本的是动作发生之前的一整套能力生产过程。


按照跨维的划分,这些成本主要取决于三个方面:基础设施能否从重复的人力投入沉淀为长期工具资产;能否用尽可能少的昂贵真实数据,获得更多有效训练经验;数据和模型能否跨本体、跨场景、跨任务复用。


这些投入最终指向同一个指标:


Marginal Cost of New Capability—— 获取新能力的边际成本。


如果机器人从第 1 项能力扩展到第 50 项、第 100 项能力,每一项都需要投入近似相同的数据、算力和工程资源,那么能力数量虽然增加了,本质上仍然是项目交付。


只有当机器人新增一个技能、进入一个场景或适配一种本体时,所需的新增投入随着积累不断减少,Physical AI 才开始具备规模经济。


因此,衡量通用物理智能能否成立,不能只看单次 Demo 的成功率,更要看模型的能力边界能否持续扩张,同时让新增能力的成本曲线不断向下


重新看机器人技术栈:

本质上是在降低能力生产成本


从获取新能力的边际成本出发,重新审视机器人技术栈,会发现数据、预训练、仿真、后训练和真实部署并不是彼此孤立的环节。它们共同解决的是一个问题:怎样让机器人获得下一项能力时,投入更少的数据、算力和人工。


跨维将这条路径概括为四个环节:人类经验(Experience)、合成杠杆(Leverage)、能力聚合(Condensation)和飞轮扩张(Expansion)。


Experience:

让一次学习成为可复用的能力资产


机器人行业并不缺数据,问题在于不同来源的数据很难直接复用。


本体、相机、坐标系、控制频率和动作空间的差异,将数据分割成一个个孤岛。如果一份数据只能用于一台机器人或一个任务,每增加一项新技能,就要重新支付一遍数据成本。


因此,统一数据表达和预训练的意义,不只是提高单个任务的模型指标,也在于让已经获得的数据继续服务新的任务和本体。


跨维的做法是,通过统一坐标系保留任务、物体和交互中的有效差异,消除坐标、格式和标定口径造成的无效差异。在此基础上,Dexterity-BEV 进一步完成空间、动作和时序对齐,使第一视角、遥操作、仿真和跨本体真机数据能够进入统一的训练体系。


这些数据再通过预训练沉淀为模型能力,让一次学习形成可训练、可迁移、可扩展的能力资产。


Physical Token经济学:下一项能力更便宜,机器人才能真正规模化


Leverage:

用少量真实数据撬动更多训练经验


现实世界中的试错成本很高。设备需要占用,人需要参与,失败还可能带来物料损耗和安全风险。如果每项新能力都依靠大量真机试错,机器人很难覆盖更多场景。


Real2Sim 和生成式仿真的作用,是将大量重复试错转移到可以并行运行、自动重置的虚拟环境中。少量真实数据在这里成为一个起点,用来生成更多低成本的训练经验。


据跨维介绍,自研的 DexVerse 具身智能引擎能够生成包含刚体、软体、力觉和触觉等物理特性的高保真仿真环境,覆盖柔性线缆、布料、液体、切割和铰链式物体等复杂任务。GS-World 生成式仿真引擎则进一步压缩环境搭建时间,原本需要数天完成的仿真任务环境,可以缩短至 10 余分钟生成。


这一步的核心,是用尽可能少的昂贵真实数据,撬动尽可能多的有效训练经验。


Physical Token经济学:下一项能力更便宜,机器人才能真正规模化


Condensation:

把通用能力转化为可靠技能


基础模型积累的是通用知识,但进入工业、商业和物流等具体场景后,机器人仍需要把这些知识转化为能够稳定执行的任务能力。


如果每进入一个新场景,都要重新训练模型,后训练仍然只是项目开发;只有建立在已有模型基座之上,利用仿真数据、后训练和强化学习快速完成任务适配,才有可能形成可复制的能力生产流程。


因此,能力聚合解决的不是「还要不要后训练」,而是如何用更少的任务专用数据、训练资源和现场工程,将通用能力高效转化为任务级可靠技能。


Expansion:

让每一次部署降低下一次能力的成本


机器人进入真实世界后,会遇到实验室和仿真环境中难以穷举的失败、边界状态、新物体和新任务。这些数据往往具有更高的信息密度。


如果部署数据留在单个项目中,经验留在工程师脑中,模型也停留在一个专家技能里,那么下一次进入新场景时,仍然需要从头开始。这样的商业化可以产生收入,却难以形成技术复利。


飞轮扩张的关键,是建立真实部署反馈闭环:将部署中获得的高价值数据持续回流模型,反哺预训练和后训练。模型能力增强后,下一次进入新场景所需的数据、训练和调试随之减少。


这样,一个项目就不再只是一次交付,也是下一轮能力生产的数据入口。


Physical Token经济学:下一项能力更便宜,机器人才能真正规模化


WRC 现场

三个 Demo 指向同一套能力生产逻辑


WRC 2026 现场,跨维展示了手机装机质检、商超自主扫码,以及冰淇淋与爆米花连续操作三类任务。


这些 Demo 分别来自工业制造、零售和商业服务。任务看似没有直接联系,但从 Physical Token 经济学的角度看,它们指向的是同一个问题:一套数据、模型和仿真体系,能否以较低的新增成本进入不同场景。


手机装机质检产线由两台机器人、闭环传送带、视觉和检测设备组成。机器人需要完成动态追踪、精细装盒与拆盒、检测上下料及连续协作。其新任务适配大量依靠仿真训练,将数据生产和训练过程前置到虚拟环境,减少在真实产线上的反复采集和调试。


Physical Token经济学:下一项能力更便宜,机器人才能真正规模化


商超自主扫码面对的是更加开放的商品分布。瓶装、袋装商品的姿态不断变化,条码位置也不固定。机器人需要识别商品状态,并自主调整抓取和扫码策略。多源异构数据和世界模型,则被用于提升其对商品状态、空间关系和下一步动作的判断。


Physical Token经济学:下一项能力更便宜,机器人才能真正规模化


冰淇淋与爆米花任务展示了状态驱动和异常处理能力。当工具位置变化、纸杯缺失或出料异常时,机器人需要根据新的环境状态调整行为,而不是重复固定轨迹。


Physical Token经济学:下一项能力更便宜,机器人才能真正规模化


当然,展会 Demo 不能直接等同于规模化验证。相比又增加了几个演示场景,更值得关注的是:从一个场景走向下一个场景时,真实数据、训练、试错和现场人工的新增投入是否真的减少。


这才是三个 Demo 最终要回答的问题。


Zero-shot 或许不是起点

而是规模经济运行的结果


谈到通用机器人,行业往往期待一次决定性的模型突破:某一天,一个足够强大的基础模型出现,机器人不再需要针对不同任务反复采数、训练和调试,直接进入 Zero-shot 阶段。


但从物理世界的数据约束来看,另一条路径或许更加现实。


最开始,一个新任务仍然需要大量真实数据和现场工程。随着经验能够跨任务复用、仿真放大真实数据的价值、后训练提高通用能力向可靠技能的转化效率,再加上真实部署形成反馈闭环,新任务所需的数据、训练、试错和人工成本将逐步下降。


机器人由此进入更多场景,获得更多真实世界经验;模型能力随之增强,新场景需要的额外适配进一步减少。


从这个意义上说,Zero-shot 未必是规模化的前提,也可能是规模经济持续运行后逐渐逼近的结果。当获取新能力的边际成本足够低,Zero-shot 才会从一个模型目标变成一种产业状态。


这也解释了为什么具身智能企业很难将商业化与模型研究割裂开来。


商业化不仅要产生收入,也要为模型提供真实世界中稀缺的任务、失败和长尾数据。如果部署经验无法回流模型,企业仍然是在重复项目交付;如果只追求最终的通用模型,却无法让机器人进入真实场景,模型也会失去重要的物理经验来源。


两者需要形成闭环:用当前已经具备的能力进入真实场景,在创造商业价值的同时积累数据和经验;模型变强后,再降低进入下一个场景的成本。


这也是「沿途下蛋」的另一层含义。商业规模化不只是通用能力成熟前的权宜之计,也可能是通往通用物理智能的学习路径。


因此,Physical Token 经济学讨论的并不是通用机器人实现以后如何定价,而是一个更基础的问题:


我们能否以经济上可持续的方式,一路走到通用?


如果答案成立,Physical AI 的终局或许不是突然出现一台无所不能的机器人,而是一套能够持续进入真实场景、吸收新的经验,并以越来越低的边际成本生产可靠新能力的智能系统。


下一项能力,比上一项更便宜。


这或许才是具身智能真正拥有规模经济的开始。


文章来自于"机器之心",作者 "机器之心"。

AI转型,免费服务,就找AITNT
AITNT资源拓展
根据文章内容,系统为您匹配了更有价值的资源信息。内容由AI生成,仅供参考
1
AI代理

【开源免费】Browser-use 是一个用户AI代理直接可以控制浏览器的工具。它能够让AI 自动执行浏览器中的各种任务,如比较价格、添加购物车、回复各种社交媒体等。

项目地址:https://github.com/browser-use/browser-use


2
智能体

【开源免费】AutoGPT是一个允许用户创建和运行智能体的(AI Agents)项目。用户创建的智能体能够自动执行各种任务,从而让AI有步骤的去解决实际问题。

项目地址:https://github.com/Significant-Gravitas/AutoGPT


【开源免费】MetaGPT是一个“软件开发公司”的智能体项目,只需要输入一句话的老板需求,MetaGPT即可输出用户故事 / 竞品分析 / 需求 / 数据结构 / APIs / 文件等软件开发的相关内容。MetaGPT内置了各种AI角色,包括产品经理 / 架构师 / 项目经理 / 工程师,MetaGPT提供了一个精心调配的软件公司研发全过程的SOP。

项目地址:https://github.com/geekan/MetaGPT/blob/main/docs/README_CN.md