
智能的下一阶段,已从“模型”转向“系统可靠性和进化性”的比拼。
具身竞赛进入深水区,业界关注的重点,已经从“模型能不能想”转向“系统能不能可靠执行并持续进化”。
业界前沿不断出现新的思路和进展,不久前,NVIDIA 相关团队提出的 CaP-X 与 ASPIRE 项目,CaP-X 重点关注 Code-as-Policy 的系统评测与改进,ASPIRE 则深入探索执行轨迹分析、失败诊断和程序自动修复。均从单纯的“训练端到端策略”转向“让智能体生成可执行控制程序、在真实执行反馈中发现问题,并将修正后的能力积累为可复用技能”。
与此同时,中国团队也开始了类似尝试。
近日,由中山大学 HCP 实验室、鹏城国家实验室具身智能研究所与 X-Era Lab(拓元智慧)联合发起的 PhyAgentOS 迎来重磅升级并全面开源,迅速获得业界广泛关注。
这是一个专为物理智能模型(如VLA,WAM)、仿真环境和异构机器人打造的开源运行底座。旨在为物理智能模型(如VLA,WAM)、仿真环境和异构机器人提供统一、可管理、可追溯的执行基础设施,让 AI 从“会思考”真正走向“可靠执行”。
为了直观展示 PhyAgentOS 的实际能力,我们先来看一个真实物理场景下的多本体长程协作任务。
在一个模拟零售商店的场景中,一位顾客推着黄色购物车进入店内。XEra 移动导购机器人立即上前迎接:

随后,Piper 双臂机器人 接手精细操作任务:
整个过程通过 PhyAgentOS 的 Session 机制 统一调度,实时显示当前 Target(XEra / Piper)和 SkillRuntime(navigate、Openvla、PI0.5 等),支持人机自然交互、长时序任务分解、跨机器人协同与语义验收(Session Verified)。
这个 demo 充分体现了 PhyAgentOS 的核心价值:
大模型虽然在任务规划和语义理解上表现出色,但当智能体从虚拟屏幕走进物理世界时,却常常“用不起来”。
机械臂看似执行了指令,杯子却没有被抓住;模型返回“成功”,真实世界却毫无变化;换一个新机器人或仿真环境,整条链路就得重新搭建,;失败后,问题难以定位,经验无法有效积累。
单纯端到端策略进一步放大了这一问题。 它将感知、规划和控制高度耦合,虽然在特定场景下表现亮眼,但泛化能力差、调试困难、可解释性低,且难以跨平台迁移和长期迭代。一旦部署环境发生变化,往往需要从头训练,成本极高。
而以大模型为核心大脑、通过智能体(Agent)进行分层控制的方式,正成为突破这一瓶颈的最有效路径。
它将“思考”和“执行”清晰解耦,让大模型专注于高级规划和推理,而由底层系统负责可靠执行、状态监控、错误诊断和经验积累。这种架构不仅显著提升了系统的可调试性、可复用性和长期进化能力,更为跨平台部署和多机器人协作提供了基础。

PhyAgentOS对应的技术报告信息如下:

项目官网:https://phy-agent-os.net/
技术报告:https://arxiv.org/abs/2607.16636
GitHub:https://github.com/PhyAgentOS/PhyAgentOS
通过上面的真实购物协作 Demo 可以看到,不同形态的机器人(移动平台 + 双臂)如何在同一套系统下默契配合,共同完成复杂的长时序任务。
它就像给各种机器人装上了一套统一操作系统,让不同“身体”能够听懂同一个高层指令,并可靠地执行完成。
PhyAgentOS 以 Session(会话) 为核心,构建了一套完整的任务管理系统。它既把“思考”和“执行”有效分开,又让两者紧密配合,从根本上解决了传统机器人系统碎片化、难调试、难迁移的问题。
下面我们逐一拆解其关键设计:
▎Session 机制:任务全过程可管理、可追溯
传统机器人系统往往围绕驱动或单个动作来组织代码,长时序任务中状态管理、异常处理和资源释放极易散落在各个模块。
PhyAgentOS 将 Session(会话) 设定为最小执行单元。一次 Session 不仅明确“要做什么”,还会完整记录:
只有目标、技能、传感器、动作格式、适配器关系和安全条件全部满足,Session 才会真正启动。运行过程中,它还会持续监控心跳、超时、取消请求、策略服务状态以及 SafetyGuard。
▎Markdown 协议文件:系统状态全程透明可读
PhyAgentOS 没有把系统状态隐藏在难以查看的数据库中,而是采用一组结构化 Markdown 文件作为协议边界。
这五份核心文件就像一套任何人都能打开阅读的“工作台账”:
此外,EMBODIED.md 描述本体能力与限制,传感器配置、感知模型、动作契约和安全规则则通过 YAML 文件明确定义。
这种“状态显式化”设计带来了巨大优势:研究者可以逐步讲解,工程师可以快速排障,Agent 可以直接读取,失败后还能系统性复盘。
▎Adapter 适配机制:实现跨平台兼容与安全保障
平台间最难迁移的往往是数据格式。一台机器人可能输出两路相机 + 7维关节状态,另一套仿真环境可能是三路图像 + 23维状态。
PhyAgentOS 使用三层明确适配关系:
执行前系统会进行严格的兼容性检查(Preflight),如果不匹配就明确拒绝,避免出现隐形问题。
安全同样贯彻整条链路:认知侧 Critic 检查任务意图,Runtime Preflight 检查执行契约,Target 侧 SafetyGuard 约束工作空间与速度,Operator Override 保留人工干预权。
▎Session Verifier:把实验评测变成标准化流水线
Runtime 记录执行事实,但最终判断权交给 Agent 侧的 SessionVerifier。
系统会自动打包任务前后图像、环境快照等证据,由 Agent 进行最终判断,给出「成功」「失败」或「需要重新规划」的结论。
失败也能形成可检查的证据链,支持长期记忆和持续自进化。
▎Benchmarking:标准化实验评测流水线
PhyAgentOS 的 Benchmarking Skill 复用标准 Runtime,实现从任务生成、环境初始化、策略执行、结果记录到失败分析、Agent Retry 的完整闭环。
在 LIBERO、CALVIN、RoboCasa365 等基准测试中,系统显著提升了策略的最终完成率,同时保留 first attempt(原始能力)和 final outcome(系统干预后能力)的区分,让实验数据更加科学可信。
▎评估与进化 Showcase:让实验流水线与能力进化真实可见
一个机器人策略是否真正进步,不能只看一次 Demo 是否成功。
真正重要的是看它在哪些任务上失败了?失败后系统能否看清原因、留下可查证据,并尝试把任务继续完成?
PhyAgentOS 将这一过程纳入标准的 Session 流水线。每一次评估都是从任务生成、环境初始化、策略执行、结果记录,到失败分析、Agent Retry 和最终汇总的全链路统一管理。
在 LIBERO 基准测试中,我们使用 Pi0.5、X-VLA 等策略进行自动化评估。结果显示,在四个 suite 共 2000 个 episode 中:
Pi0.5 的首次执行成功率达 97.0%,经 PhyAgentOS Agent Retry 后,最终成功率提升至 97.8%;
X-VLA 的首次执行成功率达 97.3%,最终提升至 98.6%,系统额外救回 26 个原本失败的 episode。

图:PI0.5、X-VLA 等策略在 LIBERO 基准上的基础自动评估与 PhyAgentOS 介入性能对比。
在 CALVIN 长时序操作基准上,系统对连续任务的恢复能力得到进一步验证:

图:PI0、P0.5、X-VLA 策略在 CALVIN 基准上的基础自动评估与 PhyAgentOS 介入性能对比。
在 RoboCasa365 家庭场景基准中,恢复效果同样显著:

图:PI0.5、RLDX-1、WorldDreamer 策略在 RoboCasa365 基准上的基础自动评估与 PhyAgentOS 介入性能对比。
PhyAgentOS 并不修改策略模型本身,而是通过统一的 Session Runtime,将任务调度、执行、验收、失败分析和重试组织成完整闭环。它严格区分 First Attempt(策略原始能力)和 Final Outcome(系统介入后的最终能力),让 Benchmark 成为一条可记录、可复盘、可进化的评测流水线。
▎Unitree Go2 快速接入
无需编写底层驱动代码,只需安装环境填入用户配置,十几分钟,即可完成 Go2 机器狗从开箱到接入。

▎自动化仿真评测
通过与 Agent 交互,自动选择、启动评估流程并整理生成评估结果。

▎游戏环境中的 Agent 能力演示
PhyAgentOS 在 Minecraft 中通过 Session 协议完成从自然语言指令到游戏内执行的完整链路。

基于积累经验与自主学习的知识完成家园区域的石头与杂草清理。

在 StarDojo Lite-100 多任务 benchmark 中,PhyAgentOS 在 DeepSeek v4 Flash 上取得总分 22.0%,超过 SPIKE(Qwen3.5-397B)的 18.0% 与 SPIKE(GPT5.4)的 20.3%。
分项来看,PhyAgentOS 在 Crafting 上达到 50.0%(此前最高 baseline 为 19.0%),在 Combat 上达到 16.7%(SPIKE 为 8.3%),验证了操作系统层对复杂多步任务和战斗闭环的显著增益。
Farming 与 Exploration 分别为 28.6% 与 17.9%,仅次于参数量更大的 SPIKE。这一结果说明:通过 Memory 接口将跨 episode 的种植周期、工具配方和 NPC 交互历史写入结构化记忆,Agent 能够将失败修复后的策略沉淀为可复用 Skill,实现持续自进化。

图:在 StarDojo Lite-100 上,PhyAgentOS 与 SPIKE的各分类结果对比,SPIKE 的数值来自该论文报告的平均值。结果表明我们的PhyAgentOS仅依赖DeepSeek v4 flash即可超过GPT5.4的性能。
在《饥荒》中,接入 PhyAgentOS 后,DeepSeek v4 Flash 的平均存活天数从 1.02 天提升至 2.10 天,Day 3 生存率从 0% 提升至 30%。


图:DeepSeek v4 Flash 在《饥荒》秋季第 0 天、白天阶段(10 轮 episode)上的表现。PhyAgentOS 使 Agent 存活时间翻倍,并突破了第 3 天的生存阈值。
这些游戏验证了,物理智能体的瓶颈往往不在“模型能不能想出正确动作”,而在于“系统能否确保动作在正确时机被可靠执行,并将反馈转化为长期经验”。PhyAgentOS 正在把游戏中验证的长期记忆与自进化能力,逐步迁移到真实机器人平台。
无论您是研究者、开发者还是教育工作者,PhyAgentOS 都能为您提供有力支持。以下是它的适用场景与简单上手指南。

系统提供不依赖真实硬件的 Dummy Runtime,也支持快速连接游戏、仿真和真实机器人。
从第一条 Session 开始,你可以逐步扩展到复杂评测和多本体协同。
从 VLA 到代码即策略,从世界模型到多模态推理,我们正在快速获得越来越聪明的“大脑”。但要让这些大脑真正进入现实世界,仅有模型还远远不够。
物理智能体还需要一套能够管理任务、检查契约、监督执行、接收反馈、验收结果并持续积累经验的系统基础设施。
PhyAgentOS 正是对这个问题的回答。
当 AI 开始触碰真实世界,我们不仅要让它会想、会做,更要让每一次行动都有清晰边界、每一次结果都有可查证据、每一次失败都能成为下一次进步的坚实起点。
物理 AI 的“觉醒时刻”,或许才刚刚开始。
欢迎访问项目官网、阅读技术报告、参与共建(开放飞书、Discord开发者社区),开发者社区:https://phy-agent-os.net/#/join-us,一起推动具身智能的未来!
文章来自于"AI科技评论",作者 "张璐"。
【开源免费】Browser-use 是一个用户AI代理直接可以控制浏览器的工具。它能够让AI 自动执行浏览器中的各种任务,如比较价格、添加购物车、回复各种社交媒体等。
项目地址:https://github.com/browser-use/browser-use
【开源免费】AutoGPT是一个允许用户创建和运行智能体的(AI Agents)项目。用户创建的智能体能够自动执行各种任务,从而让AI有步骤的去解决实际问题。
项目地址:https://github.com/Significant-Gravitas/AutoGPT
【开源免费】MetaGPT是一个“软件开发公司”的智能体项目,只需要输入一句话的老板需求,MetaGPT即可输出用户故事 / 竞品分析 / 需求 / 数据结构 / APIs / 文件等软件开发的相关内容。MetaGPT内置了各种AI角色,包括产品经理 / 架构师 / 项目经理 / 工程师,MetaGPT提供了一个精心调配的软件公司研发全过程的SOP。
项目地址:https://github.com/geekan/MetaGPT/blob/main/docs/README_CN.md