正在补充深度解读,当前内容可以先阅读
论文解决了什么问题
视觉语言模型在判断物体位置、三维关系和运动轨迹时仍面临根本挑战。现有工具增强 Agent 受限于动作接口设计:一次性代码执行需在看到任何中间结果前提交完整策略,结构化 API 调用则难以在测试时灵活组合感知模块与数值计算。这两种方式都无法满足复杂 3D/4D 空间推理对开放式、可组合分析的需求。
核心方法
SpatialClaw 是一个无需训练的框架,将代码作为动作接口。它为每个样本创建持久化 Python 内核,预加载输入帧、感知工具(如 SAM3、Depth Anything 3)和科学计算库。Agent 每步生成一个 Python 代码单元,执行后可检视标准输出、变量摘要和中间可视化图像,再据此规划下一步。外层循环包含规划、代码生成、执行、反馈组装和答案提交五个阶段,系统提示编码通用空间推理原则而非任务特定指令。
实验结论
- 20 个 benchmark 平均准确率 59.9%,较现有空间 Agent 提升 11.2 个百分点
- 在 Qwen 和 Gemma4 两个家族六个骨干网络上均有一致提升,无需任务特定调整
适合谁阅读
多模态 Agent 研究者空间推理与 3D 视觉方向Agent 系统评测与基准构建Agent 系统Benchmark / 评测
可核验的原论文来源和作者
- 作者
- 作者信息暂未从原始元数据中确认
- 来源
- arXiv
- 论文 ID
- 2606.13673