Skip to content

Revisiting Multi-View Stereo: A Sequence-to-Sequence Formulation ​

本文由 paper-daily 使用 DeepSeek 自动生成,仅供快速了解论文;关键结论请以原文为准。

论文原文 · PDF · 源文件

【一句话总结】将多视图立体重构为序列到序列任务,通过相机感知Transformer与全局代价体实现多视图几何联合预测,达到最先进性能。

基本信息 ​

属性内容
作者Aoxiang Fan, Corentin Dumery, Nicolas Talabot, Pascal Fua
来源arXiv:2609.24850
发布日期2026-09-21
抓取领域体系结构/硬件加速
学科方向计算机视觉
arXiv 分类cs.CV
适用层次基础
标签【标签】多视图立体, 序列到序列, Transformer, 全局代价体, 三维重建
PDF在线阅读
代码仓库暂无

问题的初衷(Why - 为什么要做这个研究) ​

【问题的初衷】多视图立体(Multi-View Stereo, MVS)是计算机视觉中的基础问题,目标是从多张已知相机的图像中恢复精确的三维几何。传统 MVS 方法通常将问题建模为序列到一(sequence-to-one)的映射:以某一参考视图为基准,通过构建代价体(Cost Volume)并正则化来预测该视图的深度图。这类方法依赖精确的相机参数,且逐视图处理导致视图间一致性难以保证。近年来,前馈(Feed-Forward, FF)模型尝试联合估计三维几何与相机参数,实现端到端重建,但由于重建歧义(reconstruction ambiguity),即使提供真值相机参数,仍会出现几何畸变。核心矛盾在于:传统 MVS 精度高但受限于逐视图范式,FF 模型灵活但几何质量不足。因此,如何弥合二者鸿沟,在已知相机参数下实现全局一致、高精度的多视图几何重建,成为亟待解决的重要问题。本文正是针对这一空白,重新审视 MVS 的建模范式。


问题的解决(What - 提出了什么方案) ​

【问题的解决】论文提出将 MVS 从传统的序列到一映射重新表述为序列到序列(sequence-to-sequence)任务,即同时为所有输入视图预测几何,而非仅预测单个参考视图的深度。这一范式转变使模型能够像 FF 模型一样联合推理所有视图,从而显式利用视图间的几何一致性。为实现该目标,作者设计了一个基于全局 Transformer 的架构,包含两个关键组件:其一,射线图嵌入(Ray-Map Embedding),将相机参数注入图像块令牌(Patch Token),使 Transformer 具备相机感知能力;其二,统一全局代价体(Unified Global Cost Volume),替代传统逐视图代价体,在所有视图间联合捕获三维结构。与现有方法的本质区别在于:传统 MVS 逐视图构建代价体、缺乏全局交互;FF 模型虽全局但几何歧义严重;本文则在已知相机参数下,通过全局代价体与相机感知令牌实现全局一致的高精度重建,兼具二者优势。


技术方法详解(How - 怎么实现的) ​

【技术方法详解】

  • 序列到序列建模范式:将输入 N 个视图的图像与相机参数视为序列,输出为 N 个视图对应的几何(如深度图或点图),实现所有视图的联合预测,而非仅参考视图。
  • 射线图嵌入(Ray-Map Embedding):对每个像素计算其相机射线方向 r=(o,d),其中 o 为相机光心,d 为归一化方向向量。将射线信息编码后与图像块令牌相加,使 Transformer 在注意力计算中感知相机几何。
  • 统一全局代价体(Unified Global Cost Volume):不再为每个视图单独构建代价体,而是将所有视图的特征投影到统一的三维空间,构建全局代价体 V∈RH×W×D×C,其中 D 为深度采样数,C 为特征通道数,从而在所有视图间共享三维结构信息。
  • 全局 Transformer 架构:采用自注意力(Self-Attention)与交叉注意力(Cross-Attention)机制,在视图内与视图间进行特征聚合,结合全局代价体进行几何推理,输出各视图的深度或三维点。
  • 损失函数设计:通常结合深度监督损失 Ldepth 与几何一致性损失 Lconsistency,确保多视图预测的几何一致性与精度。
  • 训练策略:在多个公开基准(如 DTU、Tanks and Temples 等)上进行端到端训练,采用真值相机参数,评估几何重建精度与视图一致性。

系统架构图 ​

方法流程图 ​

核心公式与算法 ​

【核心公式】

V(p)=⨁i=1NFi(πi(p))

其中 V(p) 为三维点 p 处的全局代价体特征,Fi 为第 i 个视图的特征图,πi 为投影函数,⨁ 表示跨视图聚合操作。

ti=MLP(fi)+PosEmb(ri)

其中 ti 为第 i 个令牌,fi 为图像块特征,ri 为对应射线,PosEmb 为射线位置编码。

L=∑i=1N∥Di−Digt∥1+λLconsistency

其中 Di 为预测深度,Digt 为真值深度,λ 为一致性损失权重。


应用场景(Where - 在哪落地) ​

【应用场景】

  • 自动驾驶与机器人导航:在自动驾驶中,车辆搭载多相机系统,需实时重建周围环境的三维几何以支持避障与路径规划。本文方法可利用已知相机参数,联合预测所有视图的深度,生成全局一致的三维点云,提升环境感知的准确性与鲁棒性。预期效果是减少视图间几何冲突,提高障碍物检测与地图构建精度。
  • 数字孪生与城市建模:在智慧城市建设中,通过无人机或街景车采集多视图图像,重建城市三维模型。传统 MVS 逐视图处理易导致模型拼接不一致,本文的序列到序列范式可全局优化所有视图几何,生成无缝、高精度的城市数字孪生模型,显著降低后处理成本。
  • 虚拟现实与增强现实:在 VR/AR 中,需从多相机捕获的场景中实时重建三维几何以实现沉浸式交互。本文方法通过全局代价体与相机感知 Transformer,可快速生成一致的三维场景表示,提升虚实融合的自然度与用户体验。

具体技术细节示例(How in Action - 算法如何执行) ​

【具体技术细节示例】假设输入为 3 个视图的图像与相机参数,图像尺寸为 4×4,深度采样数 D=2。首先,将每个视图划分为 2×2 的图像块,得到 4 个令牌,每个令牌特征维度为 8。对每个像素计算射线方向,例如视图 1 的相机光心为 (0,0,0),像素 (0,0) 的射线方向为 (0.1,0.2,0.97),经位置编码后得到射线嵌入向量。将图像块令牌与射线嵌入相加,得到相机感知令牌。接着,将 3 个视图共 12 个令牌输入全局 Transformer,通过自注意力计算令牌间关系,例如视图 1 的令牌与视图 2 的令牌注意力权重为 0.8,表明强几何关联。然后,构建统一全局代价体:对每个三维点 p,将其投影到 3 个视图,采样对应特征并聚合。例如 p=(0.5,0.5,1.0) 投影到视图 1 的像素 (1,1),视图 2 的像素 (0,2),视图 3 的像素 (2,1),取三处特征均值作为该点代价体特征。最后,正则化代价体并预测各视图深度。视图 1 的深度图预测为 [[1.0,1.2],[0.9,1.1]],视图 2 为 [[1.1,1.3],[1.0,1.2]],视图 3 为 [[0.8,1.0],[0.7,0.9]]。通过一致性损失优化,确保三视图几何一致。


实验结果(Results - 效果如何) ​

【实验结果】论文在多个公开基准数据集上进行了广泛实验,包括 DTU、Tanks and Temples 以及 BlendedMVS 等。对比方法涵盖传统 MVS 方法(如 MVSNet、CasMVSNet)和前馈重建方法(如 DUSt3R、MASt3R 等)。实验采用真值相机参数,评估指标包括 Chamfer 距离、F-score 以及深度图精度。结果表明,本文方法在 DTU 数据集上 Chamfer 距离显著降低,优于 MVSNet 等基线;在 Tanks and Temples 上 F-score 提升明显,超越 FF 重建基线。消融实验验证了射线图嵌入与统一全局代价体的有效性,二者结合带来最大性能增益。整体上,方法实现了最先进(State-of-the-Art, SOTA)性能,兼具 MVS 的精度与 FF 模型的全局一致性。

实验结果可视化 ​


优势与不足 ​

【优势与不足】

  • 优势:
    1. 提出序列到序列的 MVS 新范式,实现所有视图几何的联合预测,显著提升视图间一致性。
    2. 射线图嵌入使 Transformer 具备相机感知能力,有效利用相机先验,减少几何歧义。
    3. 统一全局代价体替代逐视图代价体,增强全局三维结构捕获能力,实验达到 SOTA 性能。
  • 不足:
    1. 依赖已知相机参数,无法处理相机未知或标定不准确的场景,限制了实际部署灵活性。
    2. 全局代价体与 Transformer 架构计算开销较大,可能影响实时性与可扩展性。
    3. 在极端稀疏视图或大基线场景下的鲁棒性尚未充分验证。

相关工作 ​

【相关工作】

  • MVSNet 系列:基于代价体的传统 MVS 方法,逐视图预测深度,精度高但缺乏全局一致性。
  • DUSt3R / MASt3R:前馈式三维重建模型,联合估计几何与相机,灵活但存在几何畸变。
  • Transformer 在三维视觉中的应用:如基于注意力的点云处理与神经辐射场,本文借鉴其全局建模能力。
  • 代价体构建与正则化:传统 MVS 的核心步骤,本文将其扩展为统一全局代价体。
  • 相机感知网络:利用相机参数增强网络几何推理,本文的射线图嵌入属于此类。

未来研究方向 ​

【未来方向】

  • 相机参数未知或部分已知的序列到序列 MVS:扩展方法以联合估计相机参数与几何,减少对真值相机的依赖。
  • 高效全局代价体与稀疏注意力:降低计算复杂度,提升方法在大规模场景与实时应用中的可扩展性。
  • 多模态融合:结合激光雷达或深度传感器数据,增强几何重建的鲁棒性与精度。

一句话总结 ​

【一句话总结】将多视图立体重构为序列到序列任务,通过相机感知Transformer与全局代价体实现多视图几何联合预测,达到最先进性能。


本解读由 DeepSeek AI 自动生成,仅供参考。

Built with curiosity and a little stardust.