超越π0,中国团队用1B参数模型登顶具身智能榜单

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
超越π0,中国团队用1B参数模型登顶具身智能榜单
8476点击    2026-07-23 16:33

谁能想到,在全球具身智能操作能力的顶级榜单上,打败海外标杆模型π0的,居然是一个只有1B级参数的轻量级模型。


近日,全球具身智能领域关注度最高的公开榜单之一Evo-SOTA更新排名。


优艾智合研发的FabriVLA,在多任务操作核心基准Meta-World MT50中,以90.0%的tier-average成功率登顶第一,超过包括π0在内的一众国际知名模型。


超越π0,中国团队用1B参数模型登顶具身智能榜单


在没有堆叠数百亿参数的情况下,这个小身板模型在全难度梯度测试中拿到SOTA,其轻量化设计也为部署到机器人边缘端提供了基础。


Meta-World MT50的抓取、放置、开门、插拔等操作,与工业场景的基本工序高度重合,考验的正是在不同任务下的多任务能力和操作稳定性。


而这,恰恰是工业场景最看重的能力。


榜单成绩证明的是算法性能,但工业真正需要的是落地真实环境。


过去9年,优艾智合在半导体、能源化工、锂电等行业完成800+真实场景交付


近期,该公司又趁热打铁推出了工业具身智能大模型「智合」FabriX工业原生人形机器人「隙锋」,并喊出了一个极其激进的口号:


3年内,赋能10000个工业现场。


原本外界还觉得这步子迈得太大,但「隙锋」首发当日获得4000台意向订单。


而今,FabriVLA拿下全球SOTA,也让这4000台订单背后的逻辑越发清晰:


工业客户看重的,从来不是参数有多大,而是谁更好用。


1B级模型如何登顶具身智能Benchmark?


FabriVLA登顶绝非一次偶发的运气暴击。


超越π0,中国团队用1B参数模型登顶具身智能榜单


Evo-SOTA作为全球具身智能领域重要公开评测榜单之一,汇聚了全球高校与科技公司的主流模型。


所有结果均基于公开发表论文,具备极高的行业参考价值。


而在它选用的Meta-World MT50基准中,包含了整整50个不同任务,覆盖抓取、放置、推动、开门、插拔等多类复杂操作。


它考验的不是机器人死记硬背某一个特定动作的上限,而是同时掌握50项不同任务的多任务操作能力。


这与工业一线的诉求不谋而合。


产线上的组件千变万化,机械臂如果换个工件就罢工,对工厂来说就是灾难。


FabriVLA能拿下第一,意味着轻量化VLA模型同样可以具备顶级具身智能操作能力,为工业具身智能落地提供了模型基础。


但这引起不少人的好奇:为什么一个1B参数模型,可以击败更大的模型?


超越π0,中国团队用1B参数模型登顶具身智能榜单


FabriVLA选择围绕机器人操作任务重新设计神经网络架构。


传统VLA模型往往陷入盲目扩增参数的困局,靠硬背关节角度来应对复杂场景。


FabriVLA却提出两个关键创新


  • 门控自注意力机制:让模型预测出的一连串动作前后互相「看见」、彼此配合,并通过一个从零渐进打开的门控逐步学会动作间的时序衔接,执行复杂装配这类长序列动作时更连贯、更稳定。
  • 深浅层视觉特征融合:同时看懂零件整体结构和细微的位置、边界与姿态,处理插拔、组装、精准摆放这类精细工序时,一次到位的成功率大幅提升。


对于机器人来说,看见一个物体只是第一步。


它不仅需要知道「这是什么」,还需要知道「应该怎么操作」。


比如拿起一个零件。


高层视觉信息帮助机器人理解目标是什么。


低层视觉细节帮助机器人判断具体位置、形状和姿态。


如果只有语义理解,机器人可能知道这是一个零件,却不知道手应该伸到哪里。


如果只有视觉细节,又无法理解任务目标。


超越π0,中国团队用1B参数模型登顶具身智能榜单


FabriVLA通过「深浅层视觉特征融合」,让机器人同时拥有理解能力和精细操作能力。


而「门控自注意力机制」,则让动作序列中的每一步都能参考前后步骤,学会动作之间的衔接与配合。


简单来说,就像熟练工人的手,每一个动作都为下一个动作做好准备。


这两项设计均经过了严苛的消融实验。


消融实验显示:


去掉深浅层特征融合,tier-average成功率从90.0%降至82.9%;门控自注意力则是动作头中贡献最大的组件。


这说明FabriVLA的提升,来自于架构对真实任务的深度优化,而非单纯靠参数堆叠。


背后其实也反映了一个趋势:


具身智能正在从「参数竞赛」进入「架构竞赛」。


而1B级参数登顶,更重要的意义在于,它让机器人模型第一次距离真实部署更近了一步。


大模型解决的是机器人的「聪明」。


小模型看的是机器人「能不能天天工作」。


超越π0,中国团队用1B参数模型登顶具身智能榜单


更小的模型意味着更低推理成本、更低部署门槛,机器人也不必完全依赖云端算力。


据了解,FabriVLA未依赖大规模机器人数据预训练,仅通过单阶段联合训练实现SOTA表现。


对于工业现场而言,这一点尤其重要。


工厂需要的是稳定、实时、可靠。


而不是每一次动作,都等待远端服务器给出答案。


在Benchmark里跑出第一名,并不等于能在一线产线里直接上岗。


从学术SOTA走向工业现场,还需要一个能现场解决问题的「工业大脑」。


从FabriVLA到FabriX


真实工业环境里,机器人需要面对的是不断变化的设备、复杂的工艺流程,以及7×24小时不能停机的生产要求。


工业具身智能真正的挑战,不是让机器人完成一次任务,而是让它像熟练工一样,长期稳定地工作。


这也是FabriVLA之后,优艾智合推出智合FabriX模型的原因。


如果说FabriVLA解决的是「机器人能不能理解并完成任务」,那么FabriX解决的是「机器人能否进入工业现场持续工作」。


两者并不是简单的模型升级关系。


超越π0,中国团队用1B参数模型登顶具身智能榜单


FabriVLA证明了轻量化VLA模型具备复杂操作泛化能力。


FabriX则进一步将这种能力放入工业系统中,它不是简单的工业版VLA,而是围绕真实生产环境重新设计了一套工业具身智能技术基座


因为工业世界有自己的规则。


一个通用大模型可以允许偶尔生成错误答案。


但工业领域的机器人不行。


生产线上,一次错误动作可能导致设备损坏,一次错误调度可能影响整条产线效率。


因此,工业大模型必须向上兼容存量工业软件、向下兼容工业硬件协议,不能推倒现有产线重建,只能无缝升级改造。


而且,工业现场始终盘旋着一个「不可能三角」:


  • 追求极高泛化性,往往会牺牲动作稳定性;
  • 追求绝对可靠性,又容易沦为僵化的固定脚本;
  • 而追求生产节拍的效率,则会让大模型的慢推理不堪重负。


超越π0,中国团队用1B参数模型登顶具身智能榜单


最关键的是,单机机器人升级到数十上百台集群协同后,每新增一台机器人,整体状态空间爆炸,耦合复杂度大幅提升。


为了搬走工业具身智能的「三座大山」,FabriX没有盲目套用纯端到端的VLA路线,而是采用了Edge+Local(边端侧)双重架构。


FabriX-Edge端(边缘服务),类似工厂里的「资深工程师」。


它基于工业真机数据训练的多模态MoE基座模型,负责理解订单需求、工艺流程以及现场全局状态。


面对复杂任务,它负责拆解问题、规划路径和协调资源。


而FabriX-Local(本地执行),则更像机器人身边的「现场师傅」。


它将物理机理控制中的确定性规则作为先验知识,结合可供性交互数据Affordance Data,引导机器人完成具体动作。


同时,为底层执行设置安全约束,保证机器人在实时运动过程中不会偏离工业标准。


两者结合,让机器人既拥有AI的灵活性,也拥有工业系统的确定性。


这也是FabriX想解决的核心问题:如何让机器人既聪明,又可靠。


超越π0,中国团队用1B参数模型登顶具身智能榜单


FabriX的核心创新有两点:


确定性先验蒸馏


具身智能领域,一个长期争议是:


机器人到底应该完全依靠端到端模型学习,还是保留传统算法能力?


FabriX:别争了,融合吧!


工业场景里,纯视觉模型存在天然短板。机器人看到的是像素,但工业需要机器人理解空间关系。


比如机械臂抓取一个零件。


模型不仅要知道「这是一个零件」,还要知道:它距离机械臂多远?当前姿态是什么?应该施加多少力度?


如果完全依靠模型从图像中推理,就像让一个新人凭照片猜测精密设备参数。


泛化能力有了,但稳定性不足。


超越π0,中国团队用1B参数模型登顶具身智能榜单


FabriX则将优艾智合过去9年的工业感知算法积累,以及大量真实工业数据,转化为模型训练中的确定性先验。


通过工业专用感知编码器,将传统算法中的几何信息、空间关系等能力注入VLA模型。


在推理过程中,再通过视觉提示和结构化空间Token,让机器人同时获得端到端模型的泛化能力,以及工业算法的精度。


这背后的思路很明确。


不是让AI重新学习整个物理世界,而是把工业现场已经验证过的规律,交给AI使用。


机器人不再只是「看见」,还能真正理解自己面对的空间。


约束锚定智能体


大模型的自主推理容易产生幻觉。


这放在工业领域是非常致命的。


FabriX为了不让大模型直接下发最终调度指令,重新定义了大模型的位置。


它把订单、工艺规则与现场约束转换为标准化、可验证的形式化约束。


真正涉及任务调度、资源匹配等复杂优化问题,则交给专业求解器完成。


同时,FabriX采用任务条件确定性路由,根据不同任务激活对应专家模块,避免传统MoE架构中可能出现的随机路由问题。


超越π0,中国团队用1B参数模型登顶具身智能榜单


最终,所有输出还需要经过「双回路校验」,即在生成式AI输出动作前,设置「模型推理+规则校验」并行机制。


所有指令必须经过基准规则库的硬逻辑判卷,只有通过才放行执行。


一旦发现异常,模型能实现自我感知、自我恢复和自我诊断。


让工业智能真正进入产线


过去9年,优艾智合在半导体、能源化工、锂电等高壁垒行业完成了800+真实场景的落地。


产品覆盖30多个国家和地区,工业移动操作机器人全球市占率领先,复购率超过70%。


这些在湿热、带电、无尘等极限环境里沉淀下来的真机工业数据,构成了FabriX难以被复制的技术护城河。


超越π0,中国团队用1B参数模型登顶具身智能榜单


因为真实工业现场的数据,决定着机器人能不能成为生产力。


每一次搬运、每一次巡检、每一次复杂环境下的任务执行,都是机器人理解物理世界的训练样本。


但想让工业智能真正进入产线,仅有一个「大脑」还不够。


机器人还需要一副能够承担工作的身体。


前段时间,优艾智合发布了搭载FabriX的工业原生人形机器人「隙锋」


超越π0,中国团队用1B参数模型登顶具身智能榜单


与追求家庭全能机器人的路线不同,隙锋从工业效率和可靠性出发设计。


能够做到:今天进厂培训,第二天成为熟练工。


与传统自动化设备不同,隙锋并不是针对某一个固定动作打造的专用机器。


工业现场真正需要的,是一个面对变化时还能继续工作的智能员工。


比如同样是物料搬运,不同工厂的物料形态、摆放方式、生产节奏都可能不同。


传统机器人往往需要重新编程、重新调试。


但隙锋,在实际部署过程中,出厂时已经具备抓、取、握、拿等基础原子技能。


进入工业场景后,工程师只需采集少量岗位数据进行现场适配,即可让隙锋上岗作业,并快速迁移到不同岗位。


上线后,它还能一边工作一边自动采集数据,以24小时为周期循环自训练,实现技能的跨场景迁移与进化。


超越π0,中国团队用1B参数模型登顶具身智能榜单


能够做到在寸土寸金、地形复杂的工业车间里穿梭自如,背后除了有FabriX的加持,还离不开优艾智合的三大专利。


  • 静流悬挂机构:确保机器人在跨楼层、进出电梯、越过连廊沟坎时能够平稳运行,适应数十万平方米的庞大厂区。
  • 自研MAIC系统:内置毫秒级响应算力载体,确保实时通讯与精确控制。
  • 畅驭运动系统:全向全方位运动底盘,支持侧向横移、原地转身乃至S型曲线运动,能轻松挤进仅容一人转身的狭窄设备通道。


One more thing


具身智能行业,正在走到一个关键分叉口。


一边,是资本市场对通用AGI和超大规模模型的想象;另一边,是工业现场对稳定性、节拍和安全性的现实拷问。


接下来,行业该往何处走?


优艾智合用1B参数的FabriVLA登顶全球SOTA,再将模型能力进一步延伸到FabriX和隙锋,给出一种方向。


或许并不是谁的模型更大,谁的话语权就高。


参数规模可以决定模型上限,但真实世界的数据、工业场景的经验,以及智能与物理系统结合的能力,决定机器人能走多远。


文章来自于"量子位",作者 "田晏林"。

AI转型,免费服务,就找AITNT
AITNT资源拓展
根据文章内容,系统为您匹配了更有价值的资源信息。内容由AI生成,仅供参考
1
AI代理

【开源免费】Browser-use 是一个用户AI代理直接可以控制浏览器的工具。它能够让AI 自动执行浏览器中的各种任务,如比较价格、添加购物车、回复各种社交媒体等。

项目地址:https://github.com/browser-use/browser-use


2
智能体

【开源免费】AutoGPT是一个允许用户创建和运行智能体的(AI Agents)项目。用户创建的智能体能够自动执行各种任务,从而让AI有步骤的去解决实际问题。

项目地址:https://github.com/Significant-Gravitas/AutoGPT


【开源免费】MetaGPT是一个“软件开发公司”的智能体项目,只需要输入一句话的老板需求,MetaGPT即可输出用户故事 / 竞品分析 / 需求 / 数据结构 / APIs / 文件等软件开发的相关内容。MetaGPT内置了各种AI角色,包括产品经理 / 架构师 / 项目经理 / 工程师,MetaGPT提供了一个精心调配的软件公司研发全过程的SOP。

项目地址:https://github.com/geekan/MetaGPT/blob/main/docs/README_CN.md