论文解决了什么问题
现有 NeRF 和 3D Gaussian Splatting 等方法依赖多视角插值,在稀疏输入下无法推断被遮挡或视野外的几何结构。纯生成式深度预测模型多在 2D 图像空间操作,缺乏跨视角的 3D 一致性先验。本文要回答的核心问题是:预训练 3D 基础模型的内部表征是否已编码隐藏表面信息,以及如何将其与生成模型结合以实现零样本新视角深度合成。
核心方法
Z3D 冻结 3DFM 骨干网络,提取第 17 层 patch token 作为高维场景表征,再用 DiT 扩散模型在该 token 空间进行条件去噪。目标视角的相对位姿经傅里叶编码后注入时间步嵌入,源视角的多层 token 通过交叉注意力提供多尺度几何条件。去噪后的 token 直接送入冻结的 DPT 解码头输出深度图,整个过程无需逐场景优化。
方法与已有工作的区别
有原文依据相比 LVSM 等神经渲染方法仅做视角插值,Z3D 显式建模被遮挡几何;相比 CUT3R 直接查询虚拟视角,Z3D 将 3DFM 表征嵌入扩散框架以获得更强的生成表达力;相比 MVGD 等联合预测方法,Z3D 解耦表征学习与生成补全,且不要求目标相机位于原点。
实验结论
- 对 VGGT 和 WorldMirror 特征训练线性探针预测分层深度图(LDI),AbsRel 分别为 0.197 和 0.167,远低于数据集平均基线的 0.319
- Z3D-VGGT 和 Z3D-WM 在 1→1 和 2→4 设定下均优于 LVSM+3DFM 和 Depth Diffusion 基线的深度指标
- 直接在像素空间做扩散的 DD 基线产生明显深度梯度尖峰和点云噪声,而 Z3D 在 token 空间扩散结果更平滑
- 仅使用第 17 层 token 做扩散可大幅降低计算成本,同时保留深度预测最关键的特征信息
- 两阶段训练策略(先 1→1 再 2→4)比直接训练多视角配置更稳定且收敛更快
局限性与证据边界
- 目标视角完全无观测时依赖模型先验 hallucination,极端遮挡区域的几何细节精度未充分验证
- 标准噪声调度器直接应用于高维 token 空间(≥1024 维)会导致不稳定,需引入时间步偏移等额外调参
- MVGD 等关键对比方法因代码不可用未能直接比较,部分基线为作者自行构建的代理方案
适合谁阅读
需要在稀疏视角下推断被遮挡几何的 3D 视觉研究者探索 3D 基础模型内部表征可解释性与复用方式的系统研究者视觉模型生成模型系统基础设施
可核验的原论文来源和作者
- 作者
- 作者信息暂未从原始元数据中确认
- 来源
- arXiv
- 论文 ID
- 2609.04174