仿真到真机零负担!轻量级方案让机械臂首次领悟“空间轨迹”

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
仿真到真机零负担!轻量级方案让机械臂首次领悟“空间轨迹”
8643点击    2026-08-17 15:01

当机器人把书放进抽屉,它看到的是一串二维图像,然而真正需要完成的,却是一段发生在三维空间、持续随时间演化的动作。


书从哪里被抓起、沿什么方向移动、最终应该落到哪里——少了任何一环,视频预测可以“看起来合理”,动作生成却未必真的可靠。


近年来,世界动作模型(World Action Models,WAMs)尝试把视频预测和动作生成统一起来:模型一边“想象”未来世界,一边生成机器人动作。


但大多数方法仍主要在二维像素空间中建模。对于真实机器人而言,这里始终横亘着一道鸿沟:


它看到的是2D投影,执行的却是3D交互。


为此,团队提出了4D-WAM——一种面向WAM、且不依赖特定模型结构的训练策略。它利用3D轨迹场中蕴含的空间结构与时间演化信息,在不改变原有推理架构的前提下,让模型学会理解动态三维世界。


仿真到真机零负担!轻量级方案让机械臂首次领悟“空间轨迹”

4D-WAM架构,效果和可视化总览


直接把4D特征“塞”进WAM,为什么反而不工作?


一种看似自然的做法,是直接对齐WAM的中间表征与4D基础模型的特征。


然而,团队的前置实验给出了一个反直觉的结果:直接匹配绝对特征不仅没有稳定带来收益,反而容易造成优化冲突。


进一步分析发现,典型视觉语言动作模型(VLA)的视觉表征与3D特征往往具有正相关性;但在基于DiT的WAM中,中间表征与Trace Anything的4D表征在多数层上接近不相关,甚至呈负相关。


两者都在描述同一个世界,却使用了不同的“表征语言”。强迫它们逐点一致,就像要求两张采用不同坐标系的地图拥有完全相同的数值。


仿真到真机零负担!轻量级方案让机械臂首次领悟“空间轨迹”

不同隐藏层输出与3D/4D重建表征的相似度


绝对表征未必兼容,但相邻帧之间“发生了什么变化”,以及运动区域“最终去向哪里”,应当描述同一个物理过程。


与其对齐静态数值,不如对齐动态规律。


4D-WAM:一条轨迹,两种互补监督


4D-WAM引入Trace Anything作为教师模型。Trace Anything提取的3D轨迹场能够提供良好的4D表征监督信号。


考虑到直接对齐绝对特征会带来优化困难,4D-WAM在训练阶段引入了两项互补的辅助目标:


  • Motion Alignment:关注局部运动;
  • Destination Alignment:关注完整片段中的最终目标。


仿真到真机零负担!轻量级方案让机械臂首次领悟“空间轨迹”

Motion Alignment与Destination Alignment的整体流程


Motion Alignment(运动对齐):对齐“如何移动”


对于相邻两帧,4D-WAM分别计算WAM token与4D轨迹表征的帧间差分,再在共享空间中对齐它们的变化方向。


这样,模型无需复制教师模型的绝对特征,只需学习与真实轨迹一致的运动趋势。


具体而言,对映射到共享空间并归一化后的相邻帧表征作差,即可得到每个token的局部运动变化:


仿真到真机零负担!轻量级方案让机械臂首次领悟“空间轨迹”


随后,通过token级余弦距离对齐两种表征中的运动方向:


仿真到真机零负担!轻量级方案让机械臂首次领悟“空间轨迹”


Destination Alignment(终点对齐):对齐“最终去哪里”


只看相邻帧,模型可能擅长短时跟踪,却忽略一段操作的最终目标。


为此,4D-WAM把首帧视为source、末帧视为destination,学习早期运动区域与最终目标区域之间的对应关系。这项约束为局部动作加入全局目标感知,使动作不仅准确,而且不易“走偏”。


对于source token i与destination token j,分别计算学生模型和教师模型的相似度:


仿真到真机零负担!轻量级方案让机械臂首次领悟“空间轨迹”


再通过带温度系数的归一化,将相似度转化为source-conditioned destination分布:


仿真到真机零负担!轻量级方案让机械臂首次领悟“空间轨迹”


通过最小化两个分布之间的KL散度,将教师模型的目标对应关系迁移到WAM:


仿真到真机零负担!轻量级方案让机械臂首次领悟“空间轨迹”


可以把它想象成一段旅程:Motion Alignment持续告诉模型下一小段路应该怎么走;Destination Alignment则提前明确最终目的地。两种监督相互补充,让整段轨迹更加精确。


Overall Training Objective:完整训练目标


Motion Alignment与Destination Alignment均作为辅助监督加入原始WAM的训练过程。完整训练目标写作:


仿真到真机零负担!轻量级方案让机械臂首次领悟“空间轨迹”


仿真到真机零负担!轻量级方案让机械臂首次领悟“空间轨迹”


4DWAM在多任务、多场景全面提升


4D-WAM并不重新设计WAM的推理架构,而是把4D时空知识作为一种只在训练阶段使用的辅助监督。训练结束后,4D教师模型、投影层以及两项对齐目标都会被完全移除,部署时仍然使用原始WAM。


这意味着,4D-WAM在获得更强时空理解能力的同时,不增加任何推理参数量、推理延迟或显存占用。*


更重要的是,这种提升并非局限于某一个模型或某一类任务。团队在FastWAM-JointLingbot-VA两种不同主干上,覆盖标准基准、七类分布外扰动、跨域随机化、未来视频预测以及真实双臂机器人任务进行了系统验证。


从RoboTwin 2.0的多任务操作,到LIBERO的空间、目标与长序列任务;从相机、背景、光照和布局变化,到真实环境中的积木插入、动态灯光抓取、扳手定位与毛巾整理,4D-WAM都展现出了稳定且可迁移的增益。


训练时多理解一点4D轨迹,推理时不多付出任何代价。


常规测试:在强基线上继续向上


4D-WAM在RoboTwin 2.0、LIBERO、LIBERO-PlusRoboTwin Clean2Rand上进行了系统评估。结果显示,在标准测试接近饱和时,它仍能稳定提高强基线;当相机、背景、光照、噪声或布局发生变化时,提升更加显著。


仿真到真机零负担!轻量级方案让机械臂首次领悟“空间轨迹”

RoboTwin 2.0与LIBERO标准基准实验结果


即使面对已经具备较强性能的基线模型,4D-WAM依然能够带来稳定增益,说明3D轨迹监督并非只在特定场景中有效。


LIBERO-Plus:七类扰动全部提升


在相机扰动下,任务成功率从27.89%提升至45.15%,绝对提升17.26个百分点;七类扰动的平均成功率提升8.8个百分点


当空间结构与观察视角发生变化时,4D轨迹意识的价值被进一步放大。


仿真到真机零负担!轻量级方案让机械臂首次领悟“空间轨迹”

LIBERO-Plus七类分布外扰动实验结果


RoboTwin Clean2Rand:更换WAM主干仍然有效


将同一训练策略迁移到Lingbot-VA后,4D-WAM在随机化场景中的成功率由34.6%提升至41.8%,Clean/Rand平均成功率由57.7%提升至61.7%


这说明4D-WAM并不依赖单一模型结构,而是一种可迁移的对齐策略。


仿真到真机零负担!轻量级方案让机械臂首次领悟“空间轨迹”

RoboTwin Clean2Rand实验结果


不只是动作更准,模型“想象”的未来也更可靠


如果4D-WAM真正改善了时空理解,那么变化不应只出现在最终成功率上,也应体现在未来视频预测中。


为此,团队在LIBERO-Plus的分布外环境中,将模型预测帧与仿真器渲染的真实未来进行比较。


仿真到真机零负担!轻量级方案让机械臂首次领悟“空间轨迹”

分布外环境中的未来预测对比


实验结果表明,4D-WAM不仅改善了最终动作执行,也让模型生成的未来更接近真实世界的演化过程。


从仿真走向真实机器人


团队进一步在ARX LIFT2双臂机器人上设计了四类真实任务:


  • 依次将四个积木插入插槽;
  • 在转盘上抓取红色的灯;
  • 在工具箱中抓取扳手;
  • 整理毛巾。


这些任务覆盖了精细操作、可变形物体、长序列推理与动态目标追踪等多种真实世界挑战。


仿真到真机零负担!轻量级方案让机械臂首次领悟“空间轨迹”

4D-WAM真实机器人四任务演示


在550条真实示范数据上联合训练后,仅经过7000步训练,4D-WAM的四任务平均进度由20.3%提升至31.8%,平均成功率由1.0%提升至5.5%


尤其在积木插槽与工具箱扳手定位任务中,模型展现出更好的任务推进与完成能力。


仿真到真机零负担!轻量级方案让机械臂首次领悟“空间轨迹”

ARX LIFT2真实机器人实验结果


更强的4D感知,需要多少额外开销?


4D-WAM的目标不是重新设计一套庞大的机器人模型,而是提供一套轻量、可迁移的训练配方。它把额外的三维感知能力留在训练阶段,不把负担带到真实部署中。


  • 训练时:冻结4D教师模型,加入轻量投影层、Motion Alignment与Destination Alignment;
  • 推理时:移除教师模型、投影层与全部对齐目标,保留原始WAM推理架构;
  • 部署时:额外推理参数、推理延迟和显存占用均为0


仿真到真机零负担!轻量级方案让机械臂首次领悟“空间轨迹”

4D-WAM的训练效率与额外开销


在预先缓存轨迹表征(离线)的设置下,每步训练时间仅由7.3秒增加至7.5秒;使用8张GPU时,总训练时间由51小时增加至52小时;额外可训练参数的存储开销为56MiB


也就是说,4D-WAM仅以约2%的总训练时间增幅,换取了跨基准、跨扰动、跨模型主干以及真实机器人任务上的持续提升;而在真正影响机器人部署效率的推理阶段,则保持零额外开销。


结语:从“预测像素”到“理解轨迹”


对于机器人而言,一个可信的世界模型不能只生成视觉上合理的未来,还需要理解:


  • 物体如何穿过三维空间;
  • 交互关系如何随时间变化;
  • 一段操作最终要抵达什么状态。


4D-WAM的出发点很简单:让模型少记一点绝对表征,多理解一点动态规律。


通过Motion Alignment与Destination Alignment,WAM在训练阶段获得了对运动与目标的双重感知,并在不增加推理负担的情况下,将这种能力带入动作生成。


从“预测像素”到“理解轨迹”,也许正是世界动作模型走向可靠机器人智能的一步。


论文链接:https://arxiv.org/abs/2608.08023
代码链接:github.com/lishanyqy/4DWAM


文章来自于"量子位",作者 "4D-WAM 团队"。

AI转型,免费服务,就找AITNT