VLA动作预测必须经过LLM吗?TurboVLA仅0.2B参数,RTX 4090上跑出32Hz在线动作预测

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
VLA动作预测必须经过LLM吗?TurboVLA仅0.2B参数,RTX 4090上跑出32Hz在线动作预测
9789点击    2026-08-03 15:30

共同第一作者:谢亨义,姚晨飞,来自华中科技大学,研究方向为 3D 视觉。

Project Lead: 梁定康,华中科技大学计算机学院青年教师,研究方向包括自动驾驶,具身智能等。


近年来,视觉 — 语言 — 动作模型(Vision-Language-Action Model,VLA)正逐渐成为通用机器人控制的重要技术路线,但当这些模型真正进入高频闭环执行时,一个矛盾越来越突出:模型越来越大、语义能力越来越强,动作更新却未必足够快。


目前,大量 VLA 模型将大语言模型置于视觉感知和动作预测的中心。每次预测动作时,视觉观测都要先进入数十亿参数的语言主干,与语言指令完成融合后,才能进一步生成机器人动作。这不仅带来了显著的计算和显存开销,也意味着:即使模型采用连续动作专家或并行动作解码器,前面的语言模型依然需要完整运行,难以从根本上消除延迟。


这引出了一个核心问题:对于已经给出明确操作指令的机器人任务,每次动作预测都必须运行一个大语言模型吗?


近期,华中科技大学团队联合华为提出实时视觉 — 语言 — 动作模型 TurboVLA。现有 VLA 通常将大语言模型作为视觉到动作的中间接口:视觉观测先与语言指令在大语言模型中完成融合,再基于得到的多模态表示生成机器人动作,即形成一条 V→L→A 的处理路径。TurboVLA 做了个减法,绕开这一中间接口,让视觉与语言特征直接交互,再据此预测连续动作,形成更直接的 V+L→A 路径。在单张 RTX 4090 上,TurboVLA 仅占用 0.9GB 运行显存,策略延迟为 31.2ms,对应约 32Hz 的在线动作预测频率;LIBERO 配置下的模型参数量仅为 0.2B。


VLA动作预测必须经过LLM吗?TurboVLA仅0.2B参数,RTX 4090上跑出32Hz在线动作预测


  • 论文题目:TurboVLA: Real-Time Vision-Language-Action Model at 32 Hz on an RTX 4090 with <1 GB VRAM
  • 论文链接:https://arxiv.org/abs/2607.27205
  • 项目主页:https://H-EmbodVis.github.io/TurboVLA
  • 代码链接:https://github.com/H-EmbodVis/TurboVLA


VLA动作预测必须经过LLM吗?TurboVLA仅0.2B参数,RTX 4090上跑出32Hz在线动作预测

图 1:TurboVLA 能够直接运行在本地 RTX 4090 上,在降低网络依赖和部署成本的同时,实现约 32Hz 的在线动作预测。


从加速动作生成,到重构执行路径


传统 LLM-centric VLA 通常先使用视觉编码器提取图像特征,再将其投影到大语言模型的 token 空间,与语言指令一起输入语言模型。随后,模型通常采用两种方式产生动作:一种是将动作离散为 token 并进行自回归生成;另一种是连接独立的连续动作专家,并行预测动作序列。自回归 VLA 需要逐个生成动作 token,因此会继承语言生成的串行解码开销。连续动作专家虽然避免了逐 token 生成,但并没有改变多模态信息的处理路径:视觉观测和语言指令仍然需要经过完整的大语言模型,动作专家最终使用的也是语言模型产生的多模态表示。


换句话说,许多现有工作优化的是动作如何生成,却没有改变动作从何种表示中生成:无论采用哪种动作头,模型仍然需要先运行完整的 LLM。


但对于 “抓取滚筒”“按下订书机”“叠起三个碗” 等具体操作指令,语言的主要作用是描述目标物体、操作类型、属性和空间关系,而不是在每次动作更新时持续进行开放式文本生成、知识推理或复杂任务分解。在这类任务中,模型真正需要解决的是:根据语言指令,从当前视觉场景中找到与任务相关的信息,并将这些信息及时转化为连续动作。


因此,TurboVLA 没有继续将问题局限在动作解码器如何加速,而是将研究重点前移到视觉、语言与动作的连接方式:如果任务指令已经明确,动作预测是否还必须依赖 LLM 表示?


VLA动作预测必须经过LLM吗?TurboVLA仅0.2B参数,RTX 4090上跑出32Hz在线动作预测

图 2:现有 VLA 先通过大语言模型融合视觉与语言信息,再基于其表示生成动作;TurboVLA 则让视觉与语言特征直接交互,并据此预测动作。


TurboVLA 让视觉与语言直接交互并生成动作


围绕这一思路,TurboVLA 做了个减法,采用了一套简洁而有效的架构。首先,视觉观测和语言指令分别由紧凑的模态编码器处理。TurboVLA 使用 DINOv3 编码多相机视觉观测,并使用 BERT 等轻量文本编码器提取指令语义。随后,模型通过双向视觉 — 语言交互建立任务与当前场景之间的对应关系。一方面,语言信息用于引导视觉特征关注与任务相关的物体和区域;另一方面,当前视觉场景也会更新语言表示,使指令特征能够适应具体环境。交互后的多模态特征再与机器人状态共同输入轻量动作解码器。解码器能够在一次前向传播中并行输出完整的连续动作块,不需要将连续动作离散为 token,也不需要逐步进行自回归生成。


因此,TurboVLA 形成了一条更加直接的 V+L→A 动作生成路径。它不是对现有大型 VLA 进行量化、剪枝或蒸馏,而是从源头简化动作预测所依赖的多模态表示:既保留语言条件控制所需的语义信息,也避免在每次动作预测中运行通用大语言模型。


VLA动作预测必须经过LLM吗?TurboVLA仅0.2B参数,RTX 4090上跑出32Hz在线动作预测

图 3:TurboVLA 分别编码视觉和语言,通过轻量双向跨模态交互构建任务相关表示,并在一次前向传播中并行预测连续动作块。


实验结果:兼顾操作性能与部署效率


研究团队分别在 LIBERO、RoboTwin 2.0 和真实机器人平台上进行了评测,验证 TurboVLA 能否在大幅降低模型规模和部署成本的同时,保持较强的语言条件操作能力。


LIBERO:仅 0.2B 参数,平均成功率达到 97.7%


在包含 40 个语言条件任务的 LIBERO 基准上,TurboVLA 取得了 97.7% 的平均成功率。完整模型仅有 0.2B 参数,在单张 RTX 4090 上的运行显存占用为 0.9GB,端到端策略延迟为 31.2ms。作为对比,在相同 RTX 4090 测试设置下,π0.5 的平均成功率为 96.9%,参数量为 3.4B,策略延迟为 93.6ms。TurboVLA 使用约 6% 的参数量,在取得更高平均成功率的同时,将策略延迟降低至约三分之一。


VLA动作预测必须经过LLM吗?TurboVLA仅0.2B参数,RTX 4090上跑出32Hz在线动作预测

图 4:TurboVLA 以 0.2B 参数取得 97.7% 的 LIBERO 平均成功率,在单张 RTX 4090 上运行显存占用仅 0.9GB,端到端策略延迟为 31.2ms。


从 50 个双臂任务到真实机器人


在 RoboTwin 2.0 实验中,TurboVLA 仅使用官方 50 个双臂任务的 clean 数据进行联合训练,并在对应的 clean 设置下进行测试,不使用 randomized 场景数据。一个统一的多任务模型取得了 60.2% 的平均成功率,超过 π0.5 的 57.0% 和 StarVLA-α 的 50.3%。与此同时,TurboVLA 的模型规模为 0.4B,在单张 RTX 4090 上的策略延迟仅为 43.4ms


研究团队还在 AgileX Piper 机械臂上测试了抓取滚筒、移开扑克牌、按下订书机和叠碗四项任务。TurboVLA 分别取得 92.5%、80.0%、90.0% 和 87.5% 的成功率,并在相同平台、训练数据和测试协议下均超过 π0.5。


这些结果表明,直接的 V+L→A 路径不仅适用于单臂仿真任务,也能够扩展到双臂控制和真实机器人部署。低延迟与低显存还使策略可以直接运行在本地边缘设备上,减少对远程服务器和网络通信的依赖。


VLA动作预测必须经过LLM吗?TurboVLA仅0.2B参数,RTX 4090上跑出32Hz在线动作预测

图 5:TurboVLA 仅使用 RoboTwin 2.0 中 50 个双臂任务的 clean 数据进行联合训练,并在 clean 设置下取得 60.2% 的平均成功率。


VLA动作预测必须经过LLM吗?TurboVLA仅0.2B参数,RTX 4090上跑出32Hz在线动作预测


绕开语言模型,语言仍然不可或缺


消融实验进一步验证了 TurboVLA 的核心判断。完全移除语言后,模型的平均成功率从 97.7% 下降至 70.8%;将自然语言替换为 Task-ID 时,成功率恢复到 95.4%,但仍低于完整语义指令。这说明语言不只是用于区分任务编号,还提供了目标物体、属性和空间关系等重要语义。


与此同时,直接拼接视觉和语言特征只能达到 95.2% 的平均成功率,而双向视觉 — 语言交互可以达到 97.7%。这表明,TurboVLA 并不是简单移除语言模型,而是用轻量语言表示和显式跨模态交互,保留动作预测真正需要的语言理解与视觉关联能力。


VLA动作预测必须经过LLM吗?TurboVLA仅0.2B参数,RTX 4090上跑出32Hz在线动作预测

图 6:完整语义指令是多任务机器人控制的关键,而双向视觉 — 语言交互能够更充分地利用视觉与语言的互补信息,优于无语言、Task-ID、直接拼接和单向交互。


总结与展望


TurboVLA 最重要的结论,并不只是 “小模型也能获得较强的机器人操作性能”,而是视觉信息在转化为机器人动作之前,未必必须先经过大语言模型。通过让视觉与语言直接交互并生成动作,TurboVLA 在显著降低模型规模、策略延迟和运行显存占用的同时,仍保持了具有竞争力的操作性能。


这项工作并不否定大语言模型在机器人系统中的价值。对于复杂语义理解、任务分解和高层规划,LLM 仍然具有重要作用;但当机器人根据当前画面持续更新动作时,未必每次预测都需要重新运行 LLM。未来,由 LLM 负责高层规划、TurboVLA 负责低延迟执行的分层系统,可能是一条更兼顾智能与效率的技术路线。TurboVLA 所重新思考的,不是如何让 LLM 更快地生成动作,而是动作生成是否必须经过大语言模型。


文章来自于"机器之心",作者 "谢亨义,姚晨飞"。

AI转型,免费服务,就找AITNT