Digital AI和Physical AI之间,曾有一道难以跨越的鸿沟。
但现在,次元壁破了。
2026年7月19日,世界人工智能大会(WAIC)期间,面壁智能正式发布了其首个具身智能技术成果MiniCPM-Robot,包含两个模型 MiniCPM-RobotManip 和MiniCPM-RobotTrack,而且都开源了。
其中,MiniCPM-RobotManip是一个基于今年5月发布的多模态大模型MiniCPM-V 4.6训练而成的通用VLA(视觉-语言-动作)模型,参数规模仅1.5B,却能完成做三明治等真实世界操作任务。

制作三明治视频(五倍速)
在具身智能赛道日益拥挤的今天,面壁智能选择了一条与众不同的路径:从一开始就以通用智能为起点。
在开源平台上看了一下,还是很有惊喜的:

GitHub 链接:https://github.com/OpenBMB/MiniCPM-Robot
Hugging Face 链接:
https://huggingface.co/openbmb/MiniCPM-RobotManip
https://huggingface.co/openbmb/MiniCPM-RobotTrack
面壁智能做通用物理智能这件事,从两个时间点似乎都能看出铺垫。
2024年初,大模型行业还在卷参数规模,百亿千亿的模型层出不穷。
面壁智能却发了MiniCPM系列端侧模型,最小参数只有几亿,主打能在手机上运行。当时很多人不理解,觉得小尺寸模型性能上限有限。
两年过去,端侧模型成了行业共识。手机厂商、汽车厂商、家电厂商都在找能在终端本地运行的小尺寸模型。
面壁智能在这个赛道里,作为先行者,积累了超过3800万的开源下载量。
现在他们用同样的思路进入了具身智能。
MiniCPM-RobotManip只有1.5B参数,在传统VLA评测榜单上与Qwen-VLA、π0.5这些知名模型性能持平,但尺寸更小,推理更快。

MiniCPM-RobotTrack只有0.9B参数,在单目标跟踪、多目标干扰跟踪、模糊指令跟踪三个维度的评测中都做到了开源模型最优。

面壁智能的朋友说过一个判断:具身智能最终要进入家庭、办公、工厂这些真实场景,模型必须能跑在终端设备上。
云端模型响应再快也有网络延迟,功能再强也有隐私风险。
所以端侧是必经之路。
MiniCPM-RobotManip的核心技术支撑,来自面壁智能今年5月发布的多模态模型MiniCPM-V 4.6。
这款模型有一个关键能力:视觉Token极致压缩。

简单来说,模型处理图片时生成的Token数量大幅减少,图像编码的计算量减半;也是和模型的参数量小有相关。
这个能力放到具身智能场景里,解决了一个很实际的问题。
VLA模型在推理时通常要处理三路相机输入,每路对应一张图片,加上文本指令,输出动作。
这个过程一秒要重复几次。
如果模型还要记住之前几秒的画面,Token数量翻倍,计算量飙升,推理速度变慢。
大多数VLA模型放弃了记忆。他们只根据当前画面做判断,不看之前发生了什么。
问题在于,很多任务天然需要记忆。
让机器人按一个按钮五次,如果模型看不到前序动作,按一次就停或者一直按不停。

RMBench就是专门测试机器人记忆能力的基准。
π0.5在RMBench上只拿到10分,接近随机水平。
MiniCPM-RobotManip凭借视觉压缩带来的计算冗余,在保留上下文记忆的同时不增加推理成本,拿了53分。
不算一个高到惊艳的分数,但在记忆这个维度上,53分已经是碾压式领先。

它证明了VLA模型可以具备上下文记忆能力,只是大多数团队没有找到正确的方法。
在看很多Demo的时候,我最直观的感受是连贯性。
机械臂在完成多步骤任务时,动作序列之间的衔接很自然,没有那种做完一步停下来重新感知的割裂感。

这种流畅度的提升在真实操作场景中不是锦上添花,是决定任务能否完成的必要条件。
MiniCPM-RobotTrack解决的,是另一个问题。
跟踪导航这件事,传统方法依赖检测加跟踪的流水线,先识别目标再追踪轨迹。
这套方案在干净环境下表现不错,一旦目标被遮挡、多个目标交叉运动、指令描述模糊,很容易丢失目标。

MiniCPM-RobotTrack的做法是端到端。
视觉观测、自然语言指令、机器人控制决策统一在一个模型里,直接从文本到行为映射,不做中间的目标检测。
在单目标跟踪任务上追踪率89.8,动态多目标干扰场景73.4,模糊指令场景80.4,全部是开源模型里的最优。
在模糊目标跟踪上,追踪率比闭源模型TrackVLA++高出17个百分点。
但真正让我觉得这件事做得扎实的,是部署层面的考虑。
MiniCPM-RobotTrack原生适配宇树Go2 Edu,提供完整的端到端部署流程。
用户只需要一台机器狗,运行一键部署脚本,不依赖任何云端服务,纯本地、纯视觉、无网络运行。

在电梯里、在地下停车场、在信号屏蔽的展馆,拔掉网卡,机器狗照常跟踪。
见过很多具身智能的demo在展会上跑得丝滑流畅,搬到客户现场就各种崩溃,原因往往很简单,现场网络环境不理想。
展厅、园区、厂区到处是信号盲区。
面壁智能联合乐聚机器人做的展厅导览方案,就是让机器人在无网环境下纯端侧运行。
多模态模型在本地理解环境、理解指令、规划路线,敏感数据不上传云端。
这个逻辑指向一个判断:机器人最终要进入人类社会,在家庭、办公、工厂等隐私场景中与人朝夕相处。
VLA模型最终一定要跑在终端上。
模型能做出来是一回事,跑得快是另一回事。
明体科技联合北京邮电大学和北京大学研发的PhyAI推理框架,发布首日就完成了对MiniCPM-Robot的适配。

在NVIDIA H20上,MiniCPM-RobotManip的推理帧率从10.12Hz提升到了36.77Hz。
36.77帧每秒意味着单次推理时间约27毫秒。
行业里有个经验值,VLA模型推理速度要在200毫秒以内,机器人操作才不会明显卡顿。27毫秒远超这个门槛。
PhyAI做了几件事。
用CUDA Graph做计算图优化,减少CPU和GPU之间的通信开销。
用Tritin编写了针对MiniCPM-Robot的融合算子,把RMSNorm加SiLU门控、Conv1D加SiLU加QKV拆分这些操作合并执行,减少中间数据的搬运次数。
这些优化听起来很底层,但在真实机器人上感受非常直接。
推理速度翻三倍,意味着机械臂从慢动作变成正常速度,意味着机器狗跟踪目标时反应更灵敏,意味着同样的硬件能做更复杂的任务。
面壁智能的思路很清晰。
模型做小,推理做快,两者配合,让具身智能从实验室演示走向真实部署。
这次WAIC上让我惊喜的两个模型,都开源了。
GitHub和Hugging Face上可以下载完整的模型权重、推理代码、部署脚本。

GitHub 链接:https://github.com/OpenBMB/MiniCPM-Robot
MiniCPM-RobotTrack还提供了宇树Go2 Edu的一键部署方案,从环境配置到摄像头接入到指令输入到控制接口,全部打包好。
这个决定在商业上未必是最优解,但在推动具身智能发展这件事上,开源是最短路径。
具身智能目前还处于很早期的阶段。
VLA模型怎么做、数据怎么采、推理怎么优化、部署怎么落地,整个行业没有统一的标准。
面壁智能此前开源的MiniCPM系列模型累计下载量超过3800万,在海外技术社区有广泛影响力。
这次把具身智能成果也开源出来,让更多人可以基于这两个模型做二次开发和应用落地。
我认识的几个做机器人创业的朋友已经开始看代码了,而且很兴奋:
MiniCPM-RobotTrack的端到端跟踪方案,可以直接用在巡检机器人上,MiniCPM-RobotManip的记忆能力,对仓储分拣任务很有价值。
开源社区的回馈,会加速模型的迭代,而迭代会让模型更好用。这是一个正循环。
想说几个我的感受。
过去两年行业在卷本体,谁的机械臂更灵活、谁的双足行走更稳定。
接下来的竞争会全面转向模型,谁的VLA更聪明、谁的推理更快、谁能在终端上跑得更流畅。
面壁智能从2024年开始布局端侧模型,当时少有人走。
两年过去,端侧智能成了行业主流叙事。这次发布MiniCPM-Robot,是他们在具身智能方向上的首次亮相。

两个模型全部开源,从算法到推理到部署全链路打通,思路很清晰。
从能说到能看,从能看到能动,从能动到能记住、能跟踪、能理解。
每一个能力的叠加都在缩小AI与物理世界之间的缝隙。
缝隙什么时候填上,没人知道。
但有人在认真填它。
对了,面壁智能最近还在招人,VLA、世界模型、硬件相关研究及工程岗位,都很核心、很有吸引力!
链接:
https://modelbest.jobs.feishu.cn/referral/position/share/?token=MjsxNzg0MTk2Mzc0NzM0Ozc1MTcxMDQyMDA4NzkzNzQzMzk7NzY2MzA1OTI3MDI5NjI3NTIzNjsxLzE
文章来自于"AI异类弗兰克",作者 "FrankGPT"。