
多模态模型的空间推理,有一种很反直觉的现象:它能看懂图里有什么,也能回答简单的左右上下,却会在换视角、判断方位、推理前后关系时突然失灵。
过去我们常把这类失败归因于“模型空间能力不够”。但MirroS最近发布的S-Space工作给出了一个更细的解释:模型内部可能已经形成了相当准确的空间地图,真正薄弱的是如何稳定读取、变换和使用这张地图。
这篇工作的价值,不在于又刷了一个空间问答分数,而在于它把研究推到了机制层。物体的位置是否被写进隐藏状态?这些位置能不能读出来?能不能被人为改写?模型答错时,是地图画错了,还是拿着地图不会转方向?
MirroS把这个内部空间工作区称为S-Space。在这个空间里,物体位置沿水平、垂直、距离三个方向连续编码。研究者可以从模型中间层读出物体坐标,也可以改写这些坐标,并观察到模型的空间判断随之改变。

图注:S-Space是模型隐藏状态中的三维空间工作区,物体位置沿水平、垂直、距离三个方向编码。
这让“空间智能”不再只是输出层的行为表现,而变成一个可以被观测、诊断和接入外部计算系统的内部结构。对世界模型、具身智能和机器人来说,这比单纯让模型多答对几道空间题更重要。
S-Space最重要的发现,是把空间推理拆成了两层:一层是感知空间,一层是操作空间。
在简单空间关系任务里,研究者从模型隐藏状态中读出两个物体的坐标,再比较它们在某个轴上的差值,就能回答“谁在左边”“谁更近”“谁在上方”。这套方法不依赖模型生成完整答案,只使用中间层的空间坐标。MirroS的文章显示,这种读出方式在CV-Bench、EmbSpatial-Bench和SpatialTunnel等评测中表现稳定。

这说明模型内部存的不是几个离散标签,而是一套连续坐标。它更像一张压缩过的内部地图。
真正拉开差距的是视角转换任务。SpinBench要求模型看到一个正面场景后,想象从左侧、右侧或背面观察时,两个物体的相对位置会如何变化。以Qwen3.6-27B为例,模型直接回答的准确率为60.96%;加入思维链推理后,准确率提升到83.56%;而如果先从S-Space读出坐标,再由外部程序执行固定视角旋转,并用确定性规则作答,准确率可以达到95.21%。

图注:从S-Space读出坐标并执行显式旋转后,视角转换准确率显著高于模型直接生成。
思维链的作用因此也变得更清楚:它不是完全无效,但也不是空间推理的万能解。MirroS追踪了Qwen在推理过程中反复出现的物体token,发现随着思维链展开,这些物体在S-Space中的相对坐标会逐渐向目标视角旋转。也就是说,模型确实在尝试“转动”内部地图;只是这种转动不够稳定、不够精确,因此仍然会在视角转换中出错。
这个差距很能说明问题。模型不是完全没有空间感。它在很多时候已经“看见了”正确位置,只是在后续推理中没能稳定完成坐标变换。
由此我们得出:多模态模型脑中有地图,但还不会可靠地转动这张地图。
对产业界来说,这个判断很关键。空间智能的下一步,不一定是让一个大模型在语言里硬想所有几何问题,而是把模型内部的空间表征接入更可靠的计算、规划和行动模块。模型负责感知世界,工具负责精确变换,Agent负责组织流程。这比“继续让模型多想几步”更接近工程现实。
S-Space的直觉并不复杂。多模态模型处理图像和文本时,会把输入变成一串token;每个token在每一层都有一个高维向量。MirroS要找的,就是这些高维向量里有没有稳定的空间方向。
具体做法是从空间问答入手。比如问模型“苹果在杯子的左边还是右边”,再把left/right的logit差异反向传播到“苹果”和“杯子”的隐藏状态上。为了排除物体身份和提示模板等干扰,研究者交换查询物体和参照物体,做角色反对称处理。经过大量样本平均后,水平、垂直、距离三个轴就被识别出来。
关键不在于又训练了一个探针,而是模型内部似乎已经存在一种线性可读的空间数据格式。物体位置不是零散地藏在网络里,而是被组织成相对稳定的三维坐标。
更强的一步是,S-Space不只能读,还能改。MirroS直接修改物体token在S-Space中的坐标,再继续模型前向计算。结果是,模型的空间判断会跟着变:左可以被推向右,近可以被推向远,上可以被推向下。颜色等非空间判断基本不受影响。
这说明S-Space不是事后解释出来的相关性,而是参与模型空间判断的内部变量。过去调试空间推理,只能看输入、输出和提示词;现在有机会直接检查模型是不是把物体放错位置、是不是混淆参照系、是不是转错了坐标。

图注:S-Space将物体位置编码在模型中间层的三维线性子空间中;改写坐标会选择性改变模型空间判断。
如果S-Space只是图像检测结果的另一种表达,它的意义会有限。MirroS的实验显示,这张内部地图更像一个动态工作区,会随着提示、视角和上下文变化。
同一套S-Space方向,不只适用于空间问答。即使提示换成单物体查询,甚至换成询问颜色的非空间问题,研究者仍然可以从物体token中读出有效坐标。多视角输入里,语言指定“以View 1为准”,模型内部坐标也会向View 1对齐。
S-Space甚至会补全画面外的空间。守门员扑向画外时,未出现的球会被放到扑救方向;狗绳绷紧时,不可见的主人会被放到牵引方向;在“某物离你更近还是更远”的问题中,“you”这个token也会稳定落在距离轴近端。
这对世界模型很重要。真实智能体不能只理解眼前看到的东西,还要维护那些暂时不可见、但仍然存在的对象。
但开放性也会带来串线。MirroS发现,socialist会更靠近水平轴左端,conservative更靠近右端;模型也会把图像中的右方直接映射成east,把上方映射成north。这些映射在某些语境下合理,但一旦题目重新定义参照系,就可能变成错误来源。

语言让模型形成更丰富的空间工作区,也会把隐喻、常识和不同参照系混在一起。要让多模态模型进入真实物理世界,光有空间表征还不够,参照系必须能分清。
S-Space从哪里来?MirroS给出的线索是,它不是某一种监督信号单独塑造出来的,而是语言、视觉和动作共同挤压出的内部结构。
语言预训练很可能是重要来源。模型要预测left、right、near、far这类词,就必须把实体和相对位置绑定起来。即使没有显式坐标监督,模型也可能在训练中逐渐形成稳定的空间轴。
但语言信号很粗,也容易混入隐喻和参照系歧义。left可以是物理左,也可以是政治左;north可以是地图上方,也可以是题目中特别定义的方向。语言能教会模型“怎么说空间”,却不一定能教会模型“怎么稳定操作空间”。
行动监督给的是另一种反馈。抓取、靠近、移动、操作,都要求模型分清局部几何:把手在哪里,按钮是否更靠前,夹爪应该落在哪一侧。这些不是一句“在旁边”就能解决的。
MirroS比较了Molmo2-ER及其下游视觉语言行动模型MolmoAct2。结果显示,从纯VLM到行动相关模型,S-Space中物体整体与功能部件的深度关系更贴近真实物理关系。
这意味着,行动学习改变的不只是模型最后做出的动作,也可能反过来校准模型内部的空间工作区。未来世界模型的竞争,核心不只是语料规模,也包括模型通过哪些模态接触世界。

如果只把S-Space看成一个解释性发现,它的意义会被低估。更重要的是,它提供了一种新的系统分工方式:多模态模型负责形成空间表征,外部模块负责可靠计算和行动执行,中间通过可读写的空间接口连接。
这对工程系统很有价值。机器人需要知道杯子的位置,也要知道杯把的朝向和可抓取区域;AR眼镜需要理解用户、物体和房间之间的空间关系;自动化Agent如果要操作网页、软件、三维环境或真实设备,也需要维护对象位置、视角和可达性。空间信息如果始终藏在黑盒里,系统很难稳定调试和升级。
S-Space这类机制研究提供了一套排查路径:模型答错时,是没识别物体,还是把物体放错位置?是位置正确但旋转错误,还是参照系混乱?不同错误对应不同改法。感知问题补数据,计算问题接工具,参照系问题改训练和评测,行动问题引入交互反馈。
从这项工作看,MirroS关注的不是单次能力展示,而是用机制可解释性理解并改造物理智能系统。S-Space把“空间智能”拆成了可观察、可干预、可工程化的部件:内部地图可以被读取、验证、修正,也可以进一步接入计算、记忆、规划和行动模块。
这正是它的行业意义。多模态模型已经显露出内部空间地图,但这张地图还没有被稳定转化为推理和行动能力。接下来的关键,不只是让模型更大、语料更多、回答更长,而是把模型机制分析变成可用基础设施。谁能打开真实系统的黑盒,理解模型内部发生了什么,并把这种理解接入感知、推理、规划和行动链路,谁就更接近可落地的物理智能。
References:
https://mirros.ai/blog/s-space
文章来自于"Z Potentials",作者 "Z Potentials"。
【开源免费】Browser-use 是一个用户AI代理直接可以控制浏览器的工具。它能够让AI 自动执行浏览器中的各种任务,如比较价格、添加购物车、回复各种社交媒体等。
项目地址:https://github.com/browser-use/browser-use
【开源免费】AutoGPT是一个允许用户创建和运行智能体的(AI Agents)项目。用户创建的智能体能够自动执行各种任务,从而让AI有步骤的去解决实际问题。
项目地址:https://github.com/Significant-Gravitas/AutoGPT
【开源免费】MetaGPT是一个“软件开发公司”的智能体项目,只需要输入一句话的老板需求,MetaGPT即可输出用户故事 / 竞品分析 / 需求 / 数据结构 / APIs / 文件等软件开发的相关内容。MetaGPT内置了各种AI角色,包括产品经理 / 架构师 / 项目经理 / 工程师,MetaGPT提供了一个精心调配的软件公司研发全过程的SOP。
项目地址:https://github.com/geekan/MetaGPT/blob/main/docs/README_CN.md
【开源免费】graphrag是微软推出的RAG项目,与传统的通过 RAG 方法使用向量相似性作为搜索技术不同,GraphRAG是使用知识图谱在推理复杂信息时大幅提高问答性能。
项目地址:https://github.com/microsoft/graphrag
【开源免费】Dify是最早一批实现RAG,Agent,模型管理等一站式AI开发的工具平台,并且项目方一直持续维护。其中在任务编排方面相对领先对手,可以帮助研发实现像字节扣子那样的功能。
项目地址:https://github.com/langgenius/dify
【开源免费】RAGFlow是和Dify类似的开源项目,该项目在大文件解析方面做的更出色,拓展编排方面相对弱一些。
项目地址:https://github.com/infiniflow/ragflow/tree/main
【开源免费】phidata是一个可以实现将数据转化成向量存储,并通过AI实现RAG功能的项目
项目地址:https://github.com/phidatahq/phidata
【开源免费】TaskingAI 是一个提供RAG,Agent,大模型管理等AI项目开发的工具平台,比LangChain更强大的中间件AI平台工具。
项目地址:https://github.com/TaskingAI/TaskingAI
【开源免费】LangGPT 是一个通过结构化和模板化的方法,编写高质量的AI提示词的开源项目。它可以让任何非专业的用户轻松创建高水平的提示词,进而高质量的帮助用户通过AI解决问题。
项目地址:https://github.com/langgptai/LangGPT/blob/main/README_zh.md
在线使用:https://kimi.moonshot.cn/kimiplus/conpg00t7lagbbsfqkq0