具身大满贯还全开源!原力灵机DM0.5登顶RoboDojo,且clone且珍惜

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
具身大满贯还全开源!原力灵机DM0.5登顶RoboDojo,且clone且珍惜
8443点击    2026-08-26 11:41

一觉醒来,机器人大脑的SOTA,易主了。


这次,原力灵机的DM0.5,登顶了具身「珠峰」——RoboDojo


具身大满贯还全开源!原力灵机DM0.5登顶RoboDojo,且clone且珍惜


要知道,这可是RoboDojo啊。。。


魔鬼级的具身评测,由香港大学多媒体实验室联合加州大学伯克利分校、清华大学等全球近20所顶尖学术机构共同发起


这些顶尖学府的「品控」有多严格?


这么说吧,截至2026年7月,仿真榜单头部模型平均成功率仅8.80%,真机榜单仅12.8%。


是的,仍在个位数挣扎。


反正就是难度和真实性极高,专治实验室闭门造车的偏科生。


如今,DM0.5拿下了第一——


  • 综合得分:24.90
  • 平均成功率:19.34%


此外,仔细看了下表格,发现这个模型有个极其突出的强项——


记忆。


具体可以看这个Cover Blocks任务:


机器人先从左到右盖住随机排列的红、绿、蓝三个积木。当颜色被完全遮挡后,再根据此前观测,按红、绿、蓝的顺序依次揭开。


DM0.5在三次随机考试中,都取得了100%成功率。


具身大满贯还全开源!原力灵机DM0.5登顶RoboDojo,且clone且珍惜


反映在数据上也很直观,RoboDojo榜单中的Memory维度,DM0.5直接猛砍了47.74分,显著领先。。。


绝对是助力其登顶,最关键的绝杀了。


具身大满贯还全开源!原力灵机DM0.5登顶RoboDojo,且clone且珍惜


这还没完。


其他权威评测,DM0.5也都打爆了。


  • LIBERO:综合成功率99.0%
  • RoboTwin 2.0:简单和复杂场景下成功率分别达到 93.6% 和 93.3%,
  • VLA-Arena:不同难度设置下的成功率分别达到 89.0%、53.6%、44.1%。
  • RoboChallenge Table30 v2:综合得分54.42,成功率43%。


而这个SOTA级别的大脑——


早已开源。


一个基模,六类场景全通过


榜单数字终究是抽象的。DM0.5的真实能力到底如何,还得看demo。


而原力灵机,大概是当前场景demo最丰富的基础模型厂商。


抗干扰、拼积木、学黄瓜、分拣快递……给我看的眼花缭乱。


但回过头来仔细一样,这些看似分散的demo,其实指向同一件事:


基模的泛化能力。


我们一个个说。


1、人类示教。


这是我觉得最有意思的demo。


DM0.5化身卡卡西,人类示教一次,它便能光速复制粘贴。


具身大满贯还全开源!原力灵机DM0.5登顶RoboDojo,且clone且珍惜


说实话,这项技能点其实并不陌生,大家都在做这个方向。


毕竟物理世界场景稀碎,你模型做得再好,总有泛化性覆盖不到的长尾任务,这类场景下鲁棒性会骤降特别多。


这就永远到不了具身的ChatGPT时刻。


目前业内的共识解法是:不追求预训练解决一切,而是在落地环节引入Human-in-the-Loop。让人类工作者拍摄一段示范视频,机器人便能像开了「写轮眼」一样即时对齐并跟随完成复杂任务。


让教机器人,变得像教徒弟。


原力灵机做的便是这件事。


而开头提到的「记忆」,则是解法的关键。


DM0.5原生支持最长60秒的记忆能力,机器人能深度记住并连贯审视自己此前做过的所有动作序列。


基于这份长记忆,模型可以直接跨越语言限制,理解人类演示的视频片段


2、精细操作。


原力灵机选择的场景,是积木。


其实今年7月我在上海WAIC看过这个demo,说实话,比视频里的精彩得多。


原力灵机联手阶跃,搁展区里拼了个长城。。。


是的,6台机器人,耗时15小时,用 81920块微型积木拼出长3.5米的长城模型


具身大满贯还全开源!原力灵机DM0.5登顶RoboDojo,且clone且珍惜


现场也是挤爆了,钻都钻不进去。


但这绝对不是个「情绪价值」demo。


积木拼装,最小的组件宽度不到1厘米,机器人必须在0.1到1毫米的尺度内完成抓取和扣合。这个精度,已经超越了人手约0.3到1毫米的自然抖动极限。


与此同时,微型积木存在工艺公差,直接大力出奇迹的话,极易错位卡死。


所以如果仔细看视频,你会发现个蛮有意思的细节。


这哥们会寸劲儿啊!


机器人会先对准,再轻轻一震、抖动下压,把积木扣住。


具身大满贯还全开源!原力灵机DM0.5登顶RoboDojo,且clone且珍惜


当然,自动纠错的能力也很关键


毕竟是模型嘛,高精度任务确实没法追求把把zero-shot,还是得靠Loop保证稳定性。


具身大满贯还全开源!原力灵机DM0.5登顶RoboDojo,且clone且珍惜


柔性物体则更需要自动纠错了。


比如这个削黄瓜的demo,一刀下去,黄瓜形态会变。模型需要实时闭环调整。


刀深几分、力道几何,如何削得干净又不伤果肉……全在毫厘之间的拿捏。


具身大满贯还全开源!原力灵机DM0.5登顶RoboDojo,且clone且珍惜


你以为黄瓜到这就完成它的使命了?


不,原力灵机还在继续鞭打黄瓜(bushi)。


但这次侧重点有所不同,是用灵巧手切。


模型通过后训练驾驭高自由度,也是对DM0.5泛化性的展示吧。


具身大满贯还全开源!原力灵机DM0.5登顶RoboDojo,且clone且珍惜


3、长程稳定高节拍。


从这开始,demo就和场景紧密结合起来了。


今年北京亦庄的WRC,原力灵机将快递流水线搬到了现场,直击物流中转站最大痛点——


单件分离。


传送带不停,每个包裹的尺寸、材质、摆放姿态都不一样,传统机械方案根本干不了这类任务。


DM0.5不依赖预设脚本,纯靠实时视觉识别和决策,平均3秒一单,准确率超99%。


具身大满贯还全开源!原力灵机DM0.5登顶RoboDojo,且clone且珍惜


上周我也是在现场近距离看过这个demo的。


说实话,论论情绪价值,我个人觉得还得是工业场景,超解压啊,跟看清洁直播一样。


至少是能看得下去的,不会慢的要死,捡个枕头都一卡一卡的。。。


ADHD患者强推打卡(bushi)。


4、抗干扰。


真实世界不是实验室,相机随时可能骤变视角,人类随时可能「空降」捣乱。


DM0.5的解法是分层双系统,即业界主流的System1与System2架构


Sys2是深思熟虑的高阶大脑。负责理解、拒绝与大局预判,剑指zero-shot;


Sys1则是动作专家网络。就像人类的直觉反射,负责handle长程复杂任务中的琐碎细节。


在这套架构加持下,即便外部视点剧烈变化,DM0.5通用Picking的鲁棒性依然极强


具身大满贯还全开源!原力灵机DM0.5登顶RoboDojo,且clone且珍惜


哪怕人类强行打断任务,机器人也能准确理解当前实际状态,自适应修正后续动作。


具身大满贯还全开源!原力灵机DM0.5登顶RoboDojo,且clone且珍惜


六类场景,从毫米级到传送带,从刚性到柔性,从执行到模仿。


同一个模型在如此差别很大的场景中都表现优秀,是很少见的。


现在大家都冲百万小时数据,但光看数据量,或许并不符合第一性原理。


如果基模没有强泛化,每个场景都单独训一个模型,demo再多,也不过是一堆散落的珍珠。


偏科是没法的Scaling Up的。


这也是我觉得DM0.5最有意思的Takeaway吧,具身模型本身的能力正在被看见,并且上限可以做到很高。


数据、架构、效率全面升级


说了这么多,原力灵机究竟是怎么做到的?


这方面,团队也早把他们的经验,毫无保留地全盘托出了。


答案分为三层,也是具身绕不开的三个核心变量:数据、架构、延迟。


先看数据。


数据决定智能上限,这也是整套具身工程中,最重要的一环,没有之一。


DM0.5的数据资产,主要分为三类。


1、真机:5万小时高精度操作,覆盖100+种丰富动作,实现秒级精细指令动作对齐。


2、Ego:10万小时场景视频,支持毫米级高精度3D Landmark生成,实现精准标注。


具身大满贯还全开源!原力灵机DM0.5登顶RoboDojo,且clone且珍惜


3、仿真:100万平空间数据建模复杂室内环境,高精度重建解决Sim2Real Gap。


具身大满贯还全开源!原力灵机DM0.5登顶RoboDojo,且clone且珍惜


感觉他们还是把质量看的很重的,不是光脑门一拍硬采。


数据量的方式则用omni融合思路解决,也是目前行业比较主流的方案,风险最小化。


再看架构。


一句话总结,DM0.5主要有三大创新,对应解决三个问题。


1、怎么记得住?


这个前面提到过,为了降低DM0.5的落地门槛,原力灵机引入了原生长记忆


具体而言,团队在上下文抽象层做了大量工作,通过高效的信息压缩技术,让4B参数的VLM在预训练阶段就能原生学习并记住历史信息。


具身大满贯还全开源!原力灵机DM0.5登顶RoboDojo,且clone且珍惜


2、怎么看得懂?


对此,原力灵机有这么一个判断:


没有语言能力的VLA,就是数据集复读机。


毕竟不管怎么说,语言确实是最方便蒸馏人类思考能力的模态了,有Language这一层赋能,就是很吃香。


于是有了具身思维链任务。


为此,DM0.5设计了具身思维链任务,用11项推理任务驱动模型,对指令、本体、环境进行三方联合建模,赋予动作生成以语义理解和世界预判能力。


这个过程中,团队可以构造了「反事实任务」,故意给出错误指令,迫使模型真正「看懂」而非机械匹配。


3、怎么对得齐?


传统动作监督是对点式的,预测轨迹与真值轨迹之间的偏差会不断累积,最终炸掉。


原力灵机做的事对齐式的动作监督,利用约束动态规划高效计算最优匹配,一次性解决动作轨迹不一致的问题。


具身大满贯还全开源!原力灵机DM0.5登顶RoboDojo,且clone且珍惜


数据和架构双剑合璧,大幅提升了DM0.5的智能上限。


但真正要能用,还得看效率。


具身最终是要在端侧实时跑的。推理不够快,参数就是坨废纸。


为此,原力灵机做了一系列优化,这里就不多做赘述,大家可以直接看官方技术报告。


最后成果如下——


  • 模型核心延迟:534.04 ms → 57.49 ms
  • 累计加速:9.29×
  • 延迟降低:89.2%
  • API 延迟:p50 67.75 ms,p90 70.01 ms
  • LIBERO 成功率:98.45% → 98.40%


硬生生加速了一个数量级啊。。。


而且,精度基本无损。


可以说是让整套VLA推理系统超进化了


具身大满贯还全开源!原力灵机DM0.5登顶RoboDojo,且clone且珍惜


登顶,是为了下山


「登顶」确实很惊艳,但说实话,这可能真还不是最值得关注的事情。


具身天上一天地上一年,冠军频繁易主,仅仅是成绩单,很容易过期。


真正能在具身周期里刻下痕迹的,是登顶之后,你愿意留下什么。


这可能也是DM0.5选择全面开源原因


不仅仅是模型权重,DM0.5的训练框架、下游任务工作流……已陆续在GitHub与Hugging Face开放,供开发者复现、魔改、扩展。


比如下面这个demo,就是原力灵机基于DM0.5,结合开源机械臂套件,监督微调出来的。


具身大满贯还全开源!原力灵机DM0.5登顶RoboDojo,且clone且珍惜


LLM领域,开源早不是啥新鲜词,从最开始的DeepSeek,到如今的GLM、Kimi、MiniMax……大家早已习惯了开源的声音。


但在具身行业,我觉得,这件事的意义真不太一样。


物理AI实在太早期,太不成熟了,这点是事实。


所以,我们需要更透明的讨论,更真实的评测,更多公开的工作……


如果谷歌当年没有放出Transfomer,OpenAI或许永远也摸索不出通往ChatGPT的路。


RoboDojo的火爆,推动了评估从「单点Demo展示」走向「标准化全科考试」。让具身真的可以被统一度量、被复现、被挑战。


DM0.5的登顶与开源,则进一步兑现了这个Benchmark的价值。让所有人看到登顶的方法论,也让方法论可以被带走、被复用。


这是原力灵机对当下这场具身竞赛的回答。


登上珠峰,从来不是为了留在山顶。


下一步,是下山——


用开源赋能生态,让第一梯队的具身大脑,走进各行各业的流水线。


GitHub:https://github.com/dexmal/opendm

Hugging Face:https://huggingface.co/Dexmal/DM05

Tech Blog:https://www.dexmal.com/blog/dm0.5


文章来自于"量子位",作者 "Jay"。

AI转型,免费服务,就找AITNT
AITNT资源拓展
根据文章内容,系统为您匹配了更有价值的资源信息。内容由AI生成,仅供参考
1
AI工作流

【开源免费】字节工作流产品扣子两大核心业务:Coze Studio(扣子开发平台)和 Coze Loop(扣子罗盘)全面开源,而且采用的是 Apache 2.0 许可证,支持商用!

项目地址:https://github.com/coze-dev/coze-studio


【开源免费】n8n是一个可以自定义工作流的AI项目,它提供了200个工作节点来帮助用户实现工作流的编排。

项目地址:https://github.com/n8n-io/n8n

在线使用:https://n8n.io/(付费


【开源免费】DB-GPT是一个AI原生数据应用开发框架,它提供开发多模型管理(SMMF)、Text2SQL效果优化、RAG框架以及优化、Multi-Agents框架协作、AWEL(智能体工作流编排)等多种技术能力,让围绕数据库构建大模型应用更简单、更方便。

项目地址:https://github.com/eosphoros-ai/DB-GPT?tab=readme-ov-file



【开源免费】VectorVein是一个不需要任何编程基础,任何人都能用的AI工作流编辑工具。你可以将复杂的工作分解成多个步骤,并通过VectorVein固定并让AI依次完成。VectorVein是字节coze的平替产品。

项目地址:https://github.com/AndersonBY/vector-vein?tab=readme-ov-file

在线使用:https://vectorvein.ai/付费

2
微调

【开源免费】XTuner 是一个高效、灵活、全能的轻量化大模型微调工具库。它帮助开发者提供一个简单易用的平台,可以对大语言模型(LLM)和多模态图文模型(VLM)进行预训练和轻量级微调。XTuner 支持多种微调算法,如 QLoRA、LoRA 和全量参数微调。

项目地址:https://github.com/InternLM/xtuner

3
无人直播

【开源免费】VideoChat是一个开源数字人实时对话,该项目支持支持语音输入和实时对话,数字人形象可自定义等功能,首次对话延迟低至3s。

项目地址:https://github.com/Henry-23/VideoChat

在线体验:https://www.modelscope.cn/studios/AI-ModelScope/video_chat


【开源免费】Streamer-Sales 销冠是一个AI直播卖货大模型。该模型具备AI生成直播文案,生成数字人形象进行直播,并通过RAG技术对现有数据进行寻找后实时回答用户问题等AI直播卖货的所有功能。

项目地址:https://github.com/PeterH0323/Streamer-Sales