Revisiting Multi-View Stereo: A Sequence-to-Sequence Formulation
本文由 paper-daily 使用 DeepSeek 自动生成,仅供快速了解论文;关键结论请以原文为准。
【一句话总结】将多视图立体重构为序列到序列任务,通过相机感知Transformer与全局代价体实现多视图几何联合预测,达到最先进性能。
基本信息
| 属性 | 内容 |
|---|---|
| 作者 | Aoxiang Fan, Corentin Dumery, Nicolas Talabot, Pascal Fua |
| 来源 | arXiv:2609.24850 |
| 发布日期 | 2026-09-21 |
| 抓取领域 | 体系结构/硬件加速 |
| 学科方向 | 计算机视觉 |
| arXiv 分类 | cs.CV |
| 适用层次 | 基础 |
| 标签 | 【标签】多视图立体, 序列到序列, Transformer, 全局代价体, 三维重建 |
| 在线阅读 | |
| 代码仓库 | 暂无 |
问题的初衷(Why - 为什么要做这个研究)
【问题的初衷】多视图立体(Multi-View Stereo, MVS)是计算机视觉中的基础问题,目标是从多张已知相机的图像中恢复精确的三维几何。传统 MVS 方法通常将问题建模为序列到一(sequence-to-one)的映射:以某一参考视图为基准,通过构建代价体(Cost Volume)并正则化来预测该视图的深度图。这类方法依赖精确的相机参数,且逐视图处理导致视图间一致性难以保证。近年来,前馈(Feed-Forward, FF)模型尝试联合估计三维几何与相机参数,实现端到端重建,但由于重建歧义(reconstruction ambiguity),即使提供真值相机参数,仍会出现几何畸变。核心矛盾在于:传统 MVS 精度高但受限于逐视图范式,FF 模型灵活但几何质量不足。因此,如何弥合二者鸿沟,在已知相机参数下实现全局一致、高精度的多视图几何重建,成为亟待解决的重要问题。本文正是针对这一空白,重新审视 MVS 的建模范式。
问题的解决(What - 提出了什么方案)
【问题的解决】论文提出将 MVS 从传统的序列到一映射重新表述为序列到序列(sequence-to-sequence)任务,即同时为所有输入视图预测几何,而非仅预测单个参考视图的深度。这一范式转变使模型能够像 FF 模型一样联合推理所有视图,从而显式利用视图间的几何一致性。为实现该目标,作者设计了一个基于全局 Transformer 的架构,包含两个关键组件:其一,射线图嵌入(Ray-Map Embedding),将相机参数注入图像块令牌(Patch Token),使 Transformer 具备相机感知能力;其二,统一全局代价体(Unified Global Cost Volume),替代传统逐视图代价体,在所有视图间联合捕获三维结构。与现有方法的本质区别在于:传统 MVS 逐视图构建代价体、缺乏全局交互;FF 模型虽全局但几何歧义严重;本文则在已知相机参数下,通过全局代价体与相机感知令牌实现全局一致的高精度重建,兼具二者优势。
技术方法详解(How - 怎么实现的)
【技术方法详解】
- 序列到序列建模范式:将输入
个视图的图像与相机参数视为序列,输出为 个视图对应的几何(如深度图或点图),实现所有视图的联合预测,而非仅参考视图。 - 射线图嵌入(Ray-Map Embedding):对每个像素计算其相机射线方向
,其中 为相机光心, 为归一化方向向量。将射线信息编码后与图像块令牌相加,使 Transformer 在注意力计算中感知相机几何。 - 统一全局代价体(Unified Global Cost Volume):不再为每个视图单独构建代价体,而是将所有视图的特征投影到统一的三维空间,构建全局代价体
,其中 为深度采样数, 为特征通道数,从而在所有视图间共享三维结构信息。 - 全局 Transformer 架构:采用自注意力(Self-Attention)与交叉注意力(Cross-Attention)机制,在视图内与视图间进行特征聚合,结合全局代价体进行几何推理,输出各视图的深度或三维点。
- 损失函数设计:通常结合深度监督损失
与几何一致性损失 ,确保多视图预测的几何一致性与精度。 - 训练策略:在多个公开基准(如 DTU、Tanks and Temples 等)上进行端到端训练,采用真值相机参数,评估几何重建精度与视图一致性。
系统架构图
方法流程图
核心公式与算法
【核心公式】
其中
其中
其中
应用场景(Where - 在哪落地)
【应用场景】
- 自动驾驶与机器人导航:在自动驾驶中,车辆搭载多相机系统,需实时重建周围环境的三维几何以支持避障与路径规划。本文方法可利用已知相机参数,联合预测所有视图的深度,生成全局一致的三维点云,提升环境感知的准确性与鲁棒性。预期效果是减少视图间几何冲突,提高障碍物检测与地图构建精度。
- 数字孪生与城市建模:在智慧城市建设中,通过无人机或街景车采集多视图图像,重建城市三维模型。传统 MVS 逐视图处理易导致模型拼接不一致,本文的序列到序列范式可全局优化所有视图几何,生成无缝、高精度的城市数字孪生模型,显著降低后处理成本。
- 虚拟现实与增强现实:在 VR/AR 中,需从多相机捕获的场景中实时重建三维几何以实现沉浸式交互。本文方法通过全局代价体与相机感知 Transformer,可快速生成一致的三维场景表示,提升虚实融合的自然度与用户体验。
具体技术细节示例(How in Action - 算法如何执行)
【具体技术细节示例】假设输入为 3 个视图的图像与相机参数,图像尺寸为
实验结果(Results - 效果如何)
【实验结果】论文在多个公开基准数据集上进行了广泛实验,包括 DTU、Tanks and Temples 以及 BlendedMVS 等。对比方法涵盖传统 MVS 方法(如 MVSNet、CasMVSNet)和前馈重建方法(如 DUSt3R、MASt3R 等)。实验采用真值相机参数,评估指标包括 Chamfer 距离、F-score 以及深度图精度。结果表明,本文方法在 DTU 数据集上 Chamfer 距离显著降低,优于 MVSNet 等基线;在 Tanks and Temples 上 F-score 提升明显,超越 FF 重建基线。消融实验验证了射线图嵌入与统一全局代价体的有效性,二者结合带来最大性能增益。整体上,方法实现了最先进(State-of-the-Art, SOTA)性能,兼具 MVS 的精度与 FF 模型的全局一致性。
实验结果可视化
优势与不足
【优势与不足】
- 优势:
- 提出序列到序列的 MVS 新范式,实现所有视图几何的联合预测,显著提升视图间一致性。
- 射线图嵌入使 Transformer 具备相机感知能力,有效利用相机先验,减少几何歧义。
- 统一全局代价体替代逐视图代价体,增强全局三维结构捕获能力,实验达到 SOTA 性能。
- 不足:
- 依赖已知相机参数,无法处理相机未知或标定不准确的场景,限制了实际部署灵活性。
- 全局代价体与 Transformer 架构计算开销较大,可能影响实时性与可扩展性。
- 在极端稀疏视图或大基线场景下的鲁棒性尚未充分验证。
相关工作
【相关工作】
- MVSNet 系列:基于代价体的传统 MVS 方法,逐视图预测深度,精度高但缺乏全局一致性。
- DUSt3R / MASt3R:前馈式三维重建模型,联合估计几何与相机,灵活但存在几何畸变。
- Transformer 在三维视觉中的应用:如基于注意力的点云处理与神经辐射场,本文借鉴其全局建模能力。
- 代价体构建与正则化:传统 MVS 的核心步骤,本文将其扩展为统一全局代价体。
- 相机感知网络:利用相机参数增强网络几何推理,本文的射线图嵌入属于此类。
未来研究方向
【未来方向】
- 相机参数未知或部分已知的序列到序列 MVS:扩展方法以联合估计相机参数与几何,减少对真值相机的依赖。
- 高效全局代价体与稀疏注意力:降低计算复杂度,提升方法在大规模场景与实时应用中的可扩展性。
- 多模态融合:结合激光雷达或深度传感器数据,增强几何重建的鲁棒性与精度。
一句话总结
【一句话总结】将多视图立体重构为序列到序列任务,通过相机感知Transformer与全局代价体实现多视图几何联合预测,达到最先进性能。
本解读由 DeepSeek AI 自动生成,仅供参考。