论文解决了什么问题
多模态大语言模型在精确几何度量、自中心与他中心视角转换以及细粒度外观定位等三维空间推理任务上表现不稳定。现有主流方案要么在大规模空间推理数据上微调,要么为三维几何增加专用编码器,这不仅带来高昂的数据与训练成本,还会把空间先验绑定到特定训练分布和模型骨干,难以灵活适配不同任务所需的证据形式。
核心方法
GraFT 是一个无需训练的推理层,围绕冻结的多模态大语言模型工作。它以上游构建的层级化三维场景图为统一介质,根据任务需求选择三类证据:用符号几何工具直接从对象包围盒计算度量答案;按任务条件渲染仅包含相关对象并按朝向对齐的鸟瞰图以支持布局推理;对与查询对象相关的视频帧进行几何可见性评分,筛选最清晰的自中心视角用于外观属性判断。模型本身只需具备工具调用和结构化视觉输入理解能力,无需任何参数更新。
方法与已有工作的区别
有原文依据相比 Struct2D 和 GPT4Scene 等固定渲染方案,GraFT 的鸟瞰图按问题条件只绘制相关对象并保留精确比例,去除无关场景内容;相比 SpatialAgent、TIGeR 和 SpaceTools 等工具增强方法,GraFT 仅在图构建阶段执行一次感知,推理时通过确定性几何工具复用结果;相比 SpatialVLM、SpaceR 等微调或强化学习方法,GraFT 保持骨干冻结,不依赖任务特定训练。
实验结论
- 在 VSI-Bench 度量子任务中,基于三维场景图的符号几何工具比让模型直接对序列化图进行算术推理更准确,且能显著缩小弱骨干与强骨干之间的差距。
- 在方向与路径规划子任务中,任务条件的选择性鸟瞰图渲染优于原始视频输入以及 GPT4Scene 和 Struct2D 等既有 BEV 方案。
- 在 ScanQA 上,几何引导的自中心帧检索优于均匀帧采样,并在相同骨干下全面超过零样本多模态模型和微调模型 Chat-3D。
- 在完整 VSI-Bench 的真实感知设置下,GraFT 超过所有评测的闭源模型和通用开源基线,并优于多个面向空间推理微调的系统。
- 即使只使用单帧精选视角,也可在 ScanQA 上优于均匀八帧采样,说明视角质量比数量更关键。
局限性与证据边界
- 性能依赖上游三维重建与检测结果,在真实感知误差较大时部分子任务增益会收窄。
- 论文未报告端到端运行开销、图构建时延及内存占用,难以直接评估部署成本。
- 当前评估集中在 VSI-Bench 和 ScanQA,缺少更多室内或动态场景基准上的泛化验证。
- 符号工具仅执行单步确定性计算,不支持多工具链式推理或复杂组合几何任务。
适合谁阅读
从事具身智能、机器人和三维视觉的研究者关注多模态大模型空间推理与工具增强系统设计的工程师多模态Agent 系统推理与规划
可核验的原论文来源和作者
- 作者
- 作者信息暂未从原始元数据中确认
- 来源
- arXiv
- 论文 ID
- 2609.03892