上海WAIC,让我印象最深的是面壁智能MiniCPM-Robot

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
上海WAIC,让我印象最深的是面壁智能MiniCPM-Robot
5348点击    2026-07-20 11:02

Digital AI和Physical AI之间,曾有一道难以跨越的鸿沟。


但现在,次元壁破了。


2026年7月19日,世界人工智能大会(WAIC)期间,面壁智能正式发布了其首个具身智能技术成果MiniCPM-Robot,包含两个模型 MiniCPM-RobotManip 和MiniCPM-RobotTrack,而且都开源了。


其中,MiniCPM-RobotManip是一个基于今年5月发布的多模态大模型MiniCPM-V 4.6训练而成的通用VLA(视觉-语言-动作)模型,参数规模仅1.5B,却能完成做三明治等真实世界操作任务。


上海WAIC,让我印象最深的是面壁智能MiniCPM-Robot

制作三明治视频(五倍速)


在具身智能赛道日益拥挤的今天,面壁智能选择了一条与众不同的路径:从一开始就以通用智能为起点。


在开源平台上看了一下,还是很有惊喜的:


上海WAIC,让我印象最深的是面壁智能MiniCPM-Robot


GitHub 链接:https://github.com/OpenBMB/MiniCPM-Robot


Hugging Face 链接:


https://huggingface.co/openbmb/MiniCPM-RobotManip


https://huggingface.co/openbmb/MiniCPM-RobotTrack


01

从语言模型到物理智能


面壁智能做通用物理智能这件事,从两个时间点似乎都能看出铺垫。


2024年初,大模型行业还在卷参数规模,百亿千亿的模型层出不穷。


面壁智能却发了MiniCPM系列端侧模型,最小参数只有几亿,主打能在手机上运行。当时很多人不理解,觉得小尺寸模型性能上限有限。


两年过去,端侧模型成了行业共识。手机厂商、汽车厂商、家电厂商都在找能在终端本地运行的小尺寸模型。


面壁智能在这个赛道里,作为先行者,积累了超过3800万的开源下载量。


现在他们用同样的思路进入了具身智能。


MiniCPM-RobotManip只有1.5B参数,在传统VLA评测榜单上与Qwen-VLA、π0.5这些知名模型性能持平,但尺寸更小,推理更快。


上海WAIC,让我印象最深的是面壁智能MiniCPM-Robot


MiniCPM-RobotTrack只有0.9B参数,在单目标跟踪、多目标干扰跟踪、模糊指令跟踪三个维度的评测中都做到了开源模型最优。


上海WAIC,让我印象最深的是面壁智能MiniCPM-Robot


面壁智能的朋友说过一个判断:具身智能最终要进入家庭、办公、工厂这些真实场景,模型必须能跑在终端设备上。


云端模型响应再快也有网络延迟,功能再强也有隐私风险。


所以端侧是必经之路。


02

视觉压缩破了记忆的局


MiniCPM-RobotManip的核心技术支撑,来自面壁智能今年5月发布的多模态模型MiniCPM-V 4.6。


这款模型有一个关键能力:视觉Token极致压缩。


上海WAIC,让我印象最深的是面壁智能MiniCPM-Robot


简单来说,模型处理图片时生成的Token数量大幅减少,图像编码的计算量减半;也是和模型的参数量小有相关。


这个能力放到具身智能场景里,解决了一个很实际的问题。


VLA模型在推理时通常要处理三路相机输入,每路对应一张图片,加上文本指令,输出动作。


这个过程一秒要重复几次。


如果模型还要记住之前几秒的画面,Token数量翻倍,计算量飙升,推理速度变慢。


大多数VLA模型放弃了记忆。他们只根据当前画面做判断,不看之前发生了什么。


问题在于,很多任务天然需要记忆。


让机器人按一个按钮五次,如果模型看不到前序动作,按一次就停或者一直按不停。


上海WAIC,让我印象最深的是面壁智能MiniCPM-Robot


RMBench就是专门测试机器人记忆能力的基准。


π0.5在RMBench上只拿到10分,接近随机水平。


MiniCPM-RobotManip凭借视觉压缩带来的计算冗余,在保留上下文记忆的同时不增加推理成本,拿了53分。


不算一个高到惊艳的分数,但在记忆这个维度上,53分已经是碾压式领先。


上海WAIC,让我印象最深的是面壁智能MiniCPM-Robot


它证明了VLA模型可以具备上下文记忆能力,只是大多数团队没有找到正确的方法。


在看很多Demo的时候,我最直观的感受是连贯性。


机械臂在完成多步骤任务时,动作序列之间的衔接很自然,没有那种做完一步停下来重新感知的割裂感。


上海WAIC,让我印象最深的是面壁智能MiniCPM-Robot


这种流畅度的提升在真实操作场景中不是锦上添花,是决定任务能否完成的必要条件。


03

端到端跟踪,补上了部署的短板


MiniCPM-RobotTrack解决的,是另一个问题。


跟踪导航这件事,传统方法依赖检测加跟踪的流水线,先识别目标再追踪轨迹。


这套方案在干净环境下表现不错,一旦目标被遮挡、多个目标交叉运动、指令描述模糊,很容易丢失目标。


上海WAIC,让我印象最深的是面壁智能MiniCPM-Robot


MiniCPM-RobotTrack的做法是端到端。


视觉观测、自然语言指令、机器人控制决策统一在一个模型里,直接从文本到行为映射,不做中间的目标检测。


在单目标跟踪任务上追踪率89.8,动态多目标干扰场景73.4,模糊指令场景80.4,全部是开源模型里的最优。


在模糊目标跟踪上,追踪率比闭源模型TrackVLA++高出17个百分点。


但真正让我觉得这件事做得扎实的,是部署层面的考虑。


MiniCPM-RobotTrack原生适配宇树Go2 Edu,提供完整的端到端部署流程。


用户只需要一台机器狗,运行一键部署脚本,不依赖任何云端服务,纯本地、纯视觉、无网络运行。


上海WAIC,让我印象最深的是面壁智能MiniCPM-Robot


在电梯里、在地下停车场、在信号屏蔽的展馆,拔掉网卡,机器狗照常跟踪。


见过很多具身智能的demo在展会上跑得丝滑流畅,搬到客户现场就各种崩溃,原因往往很简单,现场网络环境不理想。


展厅、园区、厂区到处是信号盲区。


面壁智能联合乐聚机器人做的展厅导览方案,就是让机器人在无网环境下纯端侧运行。


多模态模型在本地理解环境、理解指令、规划路线,敏感数据不上传云端。


这个逻辑指向一个判断:机器人最终要进入人类社会,在家庭、办公、工厂等隐私场景中与人朝夕相处。


VLA模型最终一定要跑在终端上。


04

推理框架,让模型跑得更快


模型能做出来是一回事,跑得快是另一回事。


明体科技联合北京邮电大学和北京大学研发的PhyAI推理框架,发布首日就完成了对MiniCPM-Robot的适配。


上海WAIC,让我印象最深的是面壁智能MiniCPM-Robot


在NVIDIA H20上,MiniCPM-RobotManip的推理帧率从10.12Hz提升到了36.77Hz。


36.77帧每秒意味着单次推理时间约27毫秒。


行业里有个经验值,VLA模型推理速度要在200毫秒以内,机器人操作才不会明显卡顿。27毫秒远超这个门槛。


PhyAI做了几件事。


用CUDA Graph做计算图优化,减少CPU和GPU之间的通信开销。


用Tritin编写了针对MiniCPM-Robot的融合算子,把RMSNorm加SiLU门控、Conv1D加SiLU加QKV拆分这些操作合并执行,减少中间数据的搬运次数。


这些优化听起来很底层,但在真实机器人上感受非常直接。


推理速度翻三倍,意味着机械臂从慢动作变成正常速度,意味着机器狗跟踪目标时反应更灵敏,意味着同样的硬件能做更复杂的任务。


面壁智能的思路很清晰。


模型做小,推理做快,两者配合,让具身智能从实验室演示走向真实部署。


05

面壁开源,技术落地的最短路径


这次WAIC上让我惊喜的两个模型,都开源了。


GitHub和Hugging Face上可以下载完整的模型权重、推理代码、部署脚本。


上海WAIC,让我印象最深的是面壁智能MiniCPM-Robot


GitHub 链接:https://github.com/OpenBMB/MiniCPM-Robot


MiniCPM-RobotTrack还提供了宇树Go2 Edu的一键部署方案,从环境配置到摄像头接入到指令输入到控制接口,全部打包好。


这个决定在商业上未必是最优解,但在推动具身智能发展这件事上,开源是最短路径。


具身智能目前还处于很早期的阶段。


VLA模型怎么做、数据怎么采、推理怎么优化、部署怎么落地,整个行业没有统一的标准。


面壁智能此前开源的MiniCPM系列模型累计下载量超过3800万,在海外技术社区有广泛影响力。


这次把具身智能成果也开源出来,让更多人可以基于这两个模型做二次开发和应用落地。


我认识的几个做机器人创业的朋友已经开始看代码了,而且很兴奋:


MiniCPM-RobotTrack的端到端跟踪方案,可以直接用在巡检机器人上,MiniCPM-RobotManip的记忆能力,对仓储分拣任务很有价值。


开源社区的回馈,会加速模型的迭代,而迭代会让模型更好用。这是一个正循环。


想说几个我的感受。


过去两年行业在卷本体,谁的机械臂更灵活、谁的双足行走更稳定。


接下来的竞争会全面转向模型,谁的VLA更聪明、谁的推理更快、谁能在终端上跑得更流畅。


面壁智能从2024年开始布局端侧模型,当时少有人走。


两年过去,端侧智能成了行业主流叙事。这次发布MiniCPM-Robot,是他们在具身智能方向上的首次亮相。


上海WAIC,让我印象最深的是面壁智能MiniCPM-Robot


两个模型全部开源,从算法到推理到部署全链路打通,思路很清晰。


从能说到能看,从能看到能动,从能动到能记住、能跟踪、能理解。


每一个能力的叠加都在缩小AI与物理世界之间的缝隙。


缝隙什么时候填上,没人知道。


但有人在认真填它。


对了,面壁智能最近还在招人,VLA、世界模型、硬件相关研究及工程岗位,都很核心、很有吸引力!


链接:


https://modelbest.jobs.feishu.cn/referral/position/share/?token=MjsxNzg0MTk2Mzc0NzM0Ozc1MTcxMDQyMDA4NzkzNzQzMzk7NzY2MzA1OTI3MDI5NjI3NTIzNjsxLzE


文章来自于"AI异类弗兰克",作者 "FrankGPT"。

AI转型,免费服务,就找AITNT