ECCV 2026|不靠「上帝视角」,也不等「完美指令」:REAL 让具身智能体走向开放世界

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
ECCV 2026|不靠「上帝视角」,也不等「完美指令」:REAL 让具身智能体走向开放世界
6112点击    2026-09-15 13:36

真实家庭任务往往从「不完整的信息」开始:机器人不知道目标在哪里,用户也未必能一次说清自己想要什么。面对「帮我从餐桌上拿点零食」这样的模糊指令,机器人不仅要主动寻找候选物体,还要在发现面包和多个甜甜圈后进一步询问用户,确认究竟该拿哪一个。


在真实世界里,探索环境、理解意图和执行动作,本就不是三个彼此独立的问题。


围绕这一问题,来自上海交通大学、上海人工智能实验室等机构的研究者提出 REAL,一个面向开放世界移动操作的可探索、可交互、可部署的视觉具身智能体框架,并构建了贯穿仿真、数据生成、模型训练、系统评测与真机部署的完整技术链路。这篇工作已被 ECCV 2026接收。


ECCV 2026|不靠「上帝视角」,也不等「完美指令」:REAL 让具身智能体走向开放世界


📄 论文链接:https://arxiv.org/abs/2607.13653

🏗️ 项目主页:https://internrobotics.github.io/REAL/

💻 开源代码:https://github.com/InternRobotics/REAL


一、从仿真到真实世界:

没有「上帝视角」,也没有「完美指令」


面向从仿真到真实世界的迁移,REAL 重点针对现有具身智能体仿真环境中两项被过度理想化的假设:环境信息充分可知用户意图清晰明确。而在真实部署中,智能体往往面临相反的情况——环境未知,机器人缺乏先验感知;以及意图模糊,用户难以在任务开始时一次性明确需求。具体而言:


首先是环境状态信息缺失。现有仿真环境通常通过特权感知接口(oracle perception API)提供任务相关物体的数量、位置等真实信息,但在真实环境中这些信息无法被直接获取,智能体需要依靠主动探索发现物体。依赖特权信息训练得到的智能体,在真实部署中往往缺乏自主感知与探索能力。


其次是用户意图信息模糊。现有的具身智能体评测任务通常假定指令是清晰明确的,但真实场景下的用户未必知晓环境全貌,往往只能给出模糊需求,并根据智能体的反馈逐步细化任务。因此,真实环境下的智能体需要能反馈当前环境状态,并按照用户需求调整后续行为。


为应对这两类不确定性,REAL 将主动探索、视觉目标定位、自然语言意图消歧和物理操作统一到同一决策闭环中:系统以第一视角 RGB 观测为主要感知输入,并结合建图系统提供的承载区域(如桌面、柜子)作为搜索先验;当智能体在探索阶段发现多个候选目标时,智能体会主动汇报探索结果并请求用户细化指令(例如:「我找到了一个面包和两个不同的甜甜圈,您想要哪一个?」);智能体的询问由当前探索结果触发,用户反馈则进一步细化任务目标。通过这一机制,环境探索、意图确认与物理执行被统一到同一决策闭环中。


ECCV 2026|不靠「上帝视角」,也不等「完美指令」:REAL 让具身智能体走向开放世界

图 1. REAL 的工作模式与既往执行方式的对比


二、REAL:

面向开放世界移动操作的 Agentic 架构


REAL 构建于 InternUtopia 仿真平台之上,利用其高保真渲染能力、丰富的可交互仿真场景与资产,设计了适用于移动操作智能体的数据采集、训练和评测管线,最终形成了一套面向开放世界移动操作的 Agentic 框架。该框架的系统顶层架构由以下三大核心组件构成:


  • 大脑:智能体采用 Qwen3-VL-8B-Instruct 作为骨干视觉语言模型。大脑负责处理多模态观测信息、维护结构化的自摘要历史状态,并进行高层任务规划与工具调用。


  • 工具与接口:REAL 环境提供了一套不依赖特权感知信息的标准化工具链,主要包含:用于主动获取环境信息的四步探索工具(Nav_toWalk_aroundShow_object_by_categoryGaze_at),用于底层物理执行的控制接口(PickPlaceOpenClose),以及用于发现歧义并提问的主动交互工具(Ask)。为了实现工具的有效组织,框架引入了模型上下文协议(Model Context Protocol,MCP)作为统一的接口标准。高层大脑只需输出离散工具调用,通过 MCP 服务器下发并执行,从而实现了认知规划与底层执行的解耦。


  • 状态与记忆:REAL 环境将 MCP 工具的返回结果组织为结构化多模态信息作为智能体的感知信息,其中包括视觉分割掩码及对应的物体类别、原始 RGB 观测、用户反馈,以及智能体自主总结的任务子目标和历史状态。这种设计在保留有效观测信息的同时,也有助于智能体始终围绕原始任务目标进行决策。


ECCV 2026|不靠「上帝视角」,也不等「完美指令」:REAL 让具身智能体走向开放世界

图 2. REAL 框架设计


基于这一顶层架构,REAL 在环境、数据与部署层面实现了三项核心贡献:


  • 无需特权感知的物理仿真环境:仿真器去除了直接定位目标的特权感知接口,要求智能体依靠工具链在场景节点中自由探索。同时,环境还引入了模拟用户,使智能体能够在执行中动态询问并对齐意图。


  • 自动化数据生成与双阶段训练管线:REAL 基于场景与资产自动组合任务,通过规则规划器生成可执行的专家轨迹,再利用 Gemini 3 Pro 模型为轨迹补充逐步推理和结构化历史状态。在此基础上,团队采用监督微调训练智能体的基础工具调用能力,并进一步通过在线强化学习训练其闭环探索、错误恢复与主动询问能力。


  • 统一接口下的仿真到现实部署:团队构建了包含 241 个任务实例的 REAL-Bench 以验证实际效果。得益于 MCP 协议,同一套高层策略能够零样本迁移至真实的双臂移动机器人,验证了框架的可部署性。


三、技术实现:

主动探索、沟通与高低层解耦


无特权感知的主动探索与交互


在 REAL 框架中,智能体仅接收可获取的结构先验,即承载区域或场景节点(如桌面、柜体)的 ID 与语义类别。为了定位目标,智能体通过四步探索工具链(导航、多视角扫描、目标检测、对齐注视)主动获取视觉信息。系统将检测到的 2D 分割掩码反投影到 3D 空间以构建临时探索地图,并通过 SoM(Set-of-Mark)为物体分配视觉 ID。后续的抓取、放置等操作均基于视觉 ID 调用,使机器人能够完成视觉目标定位与消歧,有效区分同类但外观不同的物体。同时,REAL 接入了一个由大模型驱动的模拟用户,它能依据当前已发现的物体和任务配置给出回答,使主动沟通成为由探索结果直接触发的执行环节。


基于 MCP 协议的高低层解耦执行


得益于 MCP 协议的引入,模型「大脑」可以始终专注于任务规划与状态跟踪,并输出统一格式的离散工具调用。在此机制下,仿真环境与真实环境通过统一的工具接口被抽象为一致的交互空间当系统迁移到真机部署时,底层的连续物理控制由微调后的 $\pi_{0.5}$ 模型等专门的物理技能来接管。这种高低层解耦的设计,使得高层策略在完全不重新训练的情况下,就能直接零样本迁移到真实的物理机器人上。


SFT 与 GSPO:先完成工具对齐,再学习闭环决策


智能体采用 Qwen3-VL-8B-Instruct 作为基座模型,以兼顾多模态能力与机器人侧的推理效率。针对长程任务中容易出现的上下文膨胀问题,系统将决策过程建模为部分可观察马尔可夫决策过程,并使用结构化的自摘要历史状态,避免了在每一步重复拼接完整的交互轨迹。整个训练管线分为两个核心阶段:


  • 监督微调(SFT)实现工具对齐:在该阶段,系统利用规则规划器生成专家轨迹,并通过自动化标注模块将部分清晰指令改写为模糊指令,同时在轨迹中注入 Ask 调用及模拟用户的回答。这使得模型初步掌握了探索、操作和沟通工具的基础调用范式。
  • 在线强化学习(Online RL)提升自适应能力:为了避免模型陷入死板的轨迹模仿,REAL 引入了组序列策略优化(Group Sequence Policy Optimization,GSPO)进行闭环强化学习。相较于 GRPO,GSPO 将重要性比率与裁剪从 token 级提升到序列级,以更好地匹配序列级奖励,并提升变长轨迹强化学习的稳定性。奖励机制结合了环境状态变化、执行失败惩罚与提问预算,既鼓励智能体在必要时通过提问消除歧义,又防止其对用户产生过度依赖。


通过这套双阶段训练管线,训练后的策略会根据环境的真实反馈,自主决定何时继续探索、何时重新规划,以及何时向用户确认。


四、REAL-Bench:

评测设计与实验结果


REAL-Bench 共包含 241 个任务实例分为四个任务族:


  • 家具干扰(Furniture-Distractor Pick-and-Place,FDP)(72 个):在存在同类家具干扰的场景中完成跨容器取放,考察主动探索与基础操作闭环;


  • 家具与物体干扰(Furniture & Object-Distractor Pick-and-Place,FODP)(56 个):同时加入家具级和物体级干扰,在开放词汇场景中考察细粒度视觉定位与消歧;


  • 家具干扰交互(Furniture-Distractor Open/Close,FDO)(48 个):围绕可开合的家具完成操作,考察动态视觉变化下的物品操作和时序一致性;


  • 模拟用户闭环控制(Simulator-User-Loop,SUL)(65 个):通过刻意设置的模糊指令,考察智能体能否主动调用 Ask,并根据用户反馈完成目标对齐。


四类任务共同覆盖「探索—定位—操作—沟通」的完整执行过程,并从不同侧面检验智能体应对视觉干扰、感知动态状态、交互决策和主动探索的能力。


实验结果:SFT 学会「用工具」,RL 学会「自主交互」


ECCV 2026|不靠「上帝视角」,也不等「完美指令」:REAL 让具身智能体走向开放世界


  • 工具对齐是形成感知—行动闭环的前提。未经训练的 Qwen3-VL-8B 在 FDP、FODP 和 FDO 上的成功率均为 0%,在 SUL 上仅为 1.5%;经过 1 个 epoch 的 SFT 后,FDP 成功率提升至 45.8%。


  • 单纯增加模仿学习可能损害开放场景泛化。当 SFT 由 1 epoch 增至 2 epochs 时,FDP 从 45.8% 提升到 65.3%,但干扰更强的 FODP 从 30.4% 降至 28.6%,说明严格模仿专家轨迹可能造成过拟合。


  • 在线 RL 有助于恢复自适应探索能力。以 1-epoch SFT 的模型为起点进行 GSPO 训练后,FODP 成功率提升至 33.9%,表明环境反馈能够推动模型进行动态调整,而非仅复现训练轨迹。


  • 在线 RL 在交互任务上的提升最为明显。REAL-8B 在 SUL 上达到 56.9%,超过所有参与对比的零样本 VLM 基线,超越了作为教师模型的 Gemini-3-Pro-Preview(53.8%)和 GPT-5(52.3%)。这表明 RL 对于需要主动交互的任务具有更明显的成功率提升能力。


五、真机部署:60 个真实世界测试

episodes,78.3% 端到端成功率


为了验证 sim-to-real 能力,团队将训练得到的高层策略零样本迁移到 ARX LIFT2 双臂移动机器人


  • 高层 VLM 通过统一的 MCP 工具接口直接连接物理后端,无需重新训练;
  • 底层操作则由专用模块接管,微调后的 $\pi_{0.5}$ 负责开、合、抓、放等底层物理操作。这让 agent 只需要专注于视觉 grounding、状态跟踪与高层任务规划;
  • 60 个真实世界测试 episode 中,系统取得 78.3% 的端到端成功率,且未出现不可恢复的系统崩溃;在 600 次 VLA 原语执行中,整体可执行率为 85.3%


ECCV 2026|不靠「上帝视角」,也不等「完美指令」:REAL 让具身智能体走向开放世界

图 4. 真实任务中的部署验证了 REAL 的有效性


「把面包放进微波炉」这一任务直观展示了 REAL 在长程任务中的规划与状态维护能力。机器人并没有直接前往柜子取面包,而是先打开微波炉,再去柜子抓取面包,最后返回微波炉,放入面包并关门。这一执行顺序体现了系统对任务前置条件与操作依赖关系的理解。与此同时,REAL 通过结构化历史状态持续记录并更新当前任务进展,进展中仅保留与后续决策相关、并经过工具反馈验证的信息,而非完整的历史交互轨迹,从而避免了上下文的快速增长,减少了执行中的状态遗忘与错误累积。


六、总结


REAL 的核心是重新设计仿真训练与真实部署之间的信息边界,使具身智能体不再依赖两项传统的理想化假设——依赖现实中无法获取的「完美感知」,以及假定用户总能给出明确、完整的指令,转而面向更真实的部署条件:智能体必须通过视觉探索主动获取环境证据,在必要时通过沟通补全用户意图,并最终调用可部署的物理技能完成任务。


在此基础上,REAL 借助统一的 MCP 工具接口,将高层视觉推理与具体物理执行后端深度解耦,使得同一套高层策略能够从仿真环境零样本迁移至真实双臂移动机器人。REAL-Bench 与真机实验一致表明,促使模型学会在「看不全、说不清、执行会失败」的非理想条件下持续闭环决策,提供了一条具身智能从受限基准迈向真实世界的有效路径。


文章来自于"机器之心",作者 "机器之心"。

AI转型,免费服务,就找AITNT
AITNT资源拓展
根据文章内容,系统为您匹配了更有价值的资源信息。内容由AI生成,仅供参考
1
AI代理

【开源免费】Browser-use 是一个用户AI代理直接可以控制浏览器的工具。它能够让AI 自动执行浏览器中的各种任务,如比较价格、添加购物车、回复各种社交媒体等。

项目地址:https://github.com/browser-use/browser-use


2
智能体

【开源免费】AutoGPT是一个允许用户创建和运行智能体的(AI Agents)项目。用户创建的智能体能够自动执行各种任务,从而让AI有步骤的去解决实际问题。

项目地址:https://github.com/Significant-Gravitas/AutoGPT


【开源免费】MetaGPT是一个“软件开发公司”的智能体项目,只需要输入一句话的老板需求,MetaGPT即可输出用户故事 / 竞品分析 / 需求 / 数据结构 / APIs / 文件等软件开发的相关内容。MetaGPT内置了各种AI角色,包括产品经理 / 架构师 / 项目经理 / 工程师,MetaGPT提供了一个精心调配的软件公司研发全过程的SOP。

项目地址:https://github.com/geekan/MetaGPT/blob/main/docs/README_CN.md

3
微调

【开源免费】XTuner 是一个高效、灵活、全能的轻量化大模型微调工具库。它帮助开发者提供一个简单易用的平台,可以对大语言模型(LLM)和多模态图文模型(VLM)进行预训练和轻量级微调。XTuner 支持多种微调算法,如 QLoRA、LoRA 和全量参数微调。

项目地址:https://github.com/InternLM/xtuner