正在补充深度解读,当前内容可以先阅读
论文解决了什么问题
当前视觉-语言-动作(VLA)模型普遍采用大语言模型作为感知到动作的中心接口,视觉观测需转换为语言模型空间并与指令融合,再由语言模型解码动作。这种 LLM-centric 设计每次推理都产生巨大计算和内存开销,导致推理延迟高、控制频率低,并限制了在资源有限机器人平台上的部署。TurboVLA 试图回答:是否必须依赖大语言模型才能实现语言条件下的操作执行?能否设计一种更直接的范式,仅在轻量编码器与视觉特征之间交换信息即可形成面向控制的表示?
核心方法
TurboVLA 分别用视觉编码器(DINOv3)和轻量文本编码器(BERT)独立提取特征。在视觉-语言交互模块中,通过堆叠的双向交叉注意力层,视觉特征与指令特征直接交互,使语言语义调节视觉处理,视觉上下文也丰富指令表示,从而生成任务条件化的多模态特征。随后,动作块解码器结合机器人状态,一次性并行预测连续动作块,无需分词或自回归。整个流程不经过大语言模型,仅靠紧凑的跨模态交互实现控制。
实验结论
- LIBERO 平均成功率 97.7%,模型参数仅 0.2B
- RTX 4090 上推理延迟 31.2ms(32Hz),显存仅 0.9GB
局限性与证据边界
- 原文未提供真实机器人实验的具体成功率数字,仅提及进行了 4 个任务、每个 40 次试验并与 π0.5 对比
- 未报告在无语言或语言模糊指令下的表现,以及长序列操作的累计误差
- 仅展示了在已给定指令的执行层控制优势,不涉及高层任务分解或开放场景泛化能力
适合谁阅读
追求低延迟实时闭环的机器人操作资源受限的边缘设备部署语言条件操作执行层控制机器人与具身系统基础设施
可核验的原论文来源和作者
- 作者
- 作者信息暂未从原始元数据中确认
- 来源
- arXiv
- 论文 ID
- 2607.27205