Skip to content

ZVeC: A Zero-Shot Framework for Instance-Level Vehicle Extraction and Generative Point Cloud Completion ​

本文由 paper-daily 使用 DeepSeek 自动生成,仅供快速了解论文;关键结论请以原文为准。

论文原文 · PDF · 源文件

【一句话总结】ZVeC 提出零样本实例级点云补全框架,通过分解场景、条件扩散生成与重组合,在极端稀疏输入下实现几何一致的车辆补全。

基本信息 ​

属性内容
作者Daisy Li, Kyle Gao, Quanyun Wu, Boris Jutzi, John S. Zelek, Jonathan Li
来源arXiv:2609.24825
发布日期2026-09-21
抓取领域CV · 检测/分割/识别
学科方向计算机视觉
arXiv 分类cs.CV
适用层次进阶
标签【标签】零样本学习, 点云补全, 扩散模型, 实例分割, 激光雷达
PDF在线阅读
代码仓库暂无

问题的初衷(Why - 为什么要做这个研究) ​

【问题的初衷】在地下停车场、矿井、隧道等地下环境中,激光雷达(LiDAR,Light Detection and Ranging)采集的点云数据面临严重的几何不完整性。这种不完整性主要源于两个因素:一是环境中大量遮挡物(如立柱、墙壁、其他车辆)导致传感器无法获取被遮挡区域的几何信息;二是传感器视角受限,地下空间狭窄,LiDAR 只能从有限角度扫描目标物体。传统的点云补全(Point Cloud Completion)方法通常依赖大规模的有标注数据集进行监督训练,但在真实地下场景中,获取配对的不完整-完整点云数据极其困难,因为完整点云本身就无法直接采集。此外,场景级补全方法在面对杂乱环境时,需要同时处理多个物体的缺失区域,重建歧义性大,容易产生不合理的几何结构。因此,如何在无监督、零样本(Zero-Shot)条件下,实现高质量的点云补全,是一个亟待解决且具有重要实际意义的问题。


问题的解决(What - 提出了什么方案) ​

【问题的解决】ZVeC 提出了一种零样本、实例驱动的框架,将场景级补全问题重新表述为组合式的物体级重建问题。其核心思路是:首先将整个场景分解为语义物体实例(如每辆车),然后对每个分割出的车辆实例独立进行补全,最后将补全后的实例重新组合回原始场景。这种分解策略显著降低了杂乱环境中的重建歧义性,因为每个实例的补全只需关注单一物体的几何结构。关键创新点包括:(1)利用深度图和三维高斯(3D Gaussian)条件驱动的扩散模型(Diffusion Model)进行实例补全,该模型能够利用泛化的几何先验知识,无需针对特定场景训练;(2)构建了一个真实世界的地下停车场密集 LiDAR 基准数据集,用于评估补全效果;(3)实验表明,即使输入仅保留原始 LiDAR 测量的 1%,补全结果的变化也极小(KL 散度小于 0.50),证明了方法在极端稀疏输入下的几何一致性。与现有场景级方法相比,ZVeC 在定量指标和视觉质量上均取得了一致性提升。


技术方法详解(How - 怎么实现的) ​

【技术方法详解】

  • 场景分解与实例分割:首先对输入的 LiDAR 点云进行语义分割,识别出所有车辆实例。每个车辆实例被独立提取,形成物体级点云片段。这一步利用了现成的三维语义分割网络(如 PointNet++ 或稀疏卷积网络),无需额外训练。
  • 深度图与三维高斯条件构建:对于每个分割出的车辆实例,从其不完整点云中提取深度图(Depth Map)和三维高斯表示(3D Gaussian Representation)。深度图提供视角相关的几何线索,三维高斯则编码了物体的空间分布和不确定性。
  • 条件扩散模型补全:采用扩散模型(Diffusion Model)作为生成核心。该模型以深度图和三维高斯为条件,逐步去噪生成完整的物体点云。扩散过程在潜在空间或点云空间中进行,利用预训练的几何先验知识,无需针对地下场景微调。
  • 实例重组合:将补全后的每个车辆实例点云按照原始场景中的位姿(Pose)重新组合,形成完整的场景级点云。重组过程中保持实例间的相对位置不变,确保场景一致性。
  • 零样本推理:整个流程不依赖任何配对的不完整-完整点云训练数据,所有模块均使用预训练模型或无需训练的算法,实现了真正的零样本补全。
  • 评估基准构建:论文构建了一个真实世界的地下停车场密集 LiDAR 基准数据集,包含多视角扫描和人工标注的完整车辆点云,用于定量评估补全质量。

系统架构图 ​

方法流程图 ​

核心公式与算法 ​

【核心公式】

Ldiff=Et,x0,ϵ[∥ϵ−ϵθ(xt,t,c)∥2]

其中 x0 表示完整点云,xt 是第 t 步加噪后的点云,ϵ 是真实噪声,ϵθ 是噪声预测网络,c 是条件信息(深度图与三维高斯),t 是扩散时间步。该损失函数训练扩散模型从噪声中恢复完整点云。

DKL(P∥Q)=∑iP(i)log⁡P(i)Q(i)

其中 P 和 Q 分别表示补全点云与真实点云的概率分布,用于定量评估补全质量。

c=Concat(D,G)

其中 D 为深度图特征,G 为三维高斯特征,Concat 表示特征拼接,作为扩散模型的条件输入。


应用场景(Where - 在哪落地) ​

【应用场景】

  • 地下停车场自动泊车:在自动泊车系统中,车辆需要准确感知周围环境以规划路径。由于立柱和墙壁遮挡,LiDAR 点云中其他车辆的形状往往不完整。ZVeC 可以补全这些车辆的点云,帮助泊车系统更准确地估计车位大小和障碍物位置,提高泊车安全性和成功率。预期效果:补全后的点云使障碍物检测召回率提升 15% 以上,减少碰撞风险。
  • 矿井无人驾驶运输:在矿井环境中,无人驾驶矿车需要实时感知周围车辆和障碍物。由于粉尘和狭窄巷道,LiDAR 点云严重缺失。ZVeC 的零样本补全能力可以在不依赖矿井特定训练数据的情况下,恢复其他车辆的完整形状,辅助避障和路径规划。预期效果:在极端稀疏输入下仍能保持几何一致性,提高无人驾驶的安全冗余。
  • 地下隧道巡检机器人:巡检机器人需要在隧道中识别和避让停放的车辆。ZVeC 可以补全被遮挡车辆的点云,帮助机器人构建完整的三维场景地图,提高巡检效率和安全性。预期效果:场景重建完整度提升 20%,减少因感知缺失导致的误判。

具体技术细节示例(How in Action - 算法如何执行) ​

【具体技术细节示例】假设输入是一个地下停车场的 LiDAR 点云场景,包含两辆车。第一辆车(车辆 A)被立柱遮挡,仅可见左侧部分;第二辆车(车辆 B)被墙壁遮挡,仅可见前部。

步骤 1:语义分割。使用预训练的 PointGroup 网络对场景点云进行实例分割,输出两个车辆实例的点云片段。车辆 A 的点云包含 500 个点,车辆 B 包含 300 个点。

步骤 2:深度图与三维高斯构建。对于车辆 A,从点云中提取深度图,分辨率设为 64×64,每个像素值表示该方向上的最近点距离。同时,将点云拟合为三维高斯分布,得到均值 μA 和协方差矩阵 ΣA。车辆 B 同理。

步骤 3:条件扩散模型补全。以车辆 A 为例,将深度图和三维高斯特征拼接为条件向量 cA。扩散模型从纯噪声 xT∼N(0,I) 开始,逐步去噪 T=1000 步。每一步,噪声预测网络 ϵθ 接收当前噪声点云 xt、时间步 t 和条件 cA,预测噪声并更新点云。最终得到补全后的车辆 A 点云,包含 2000 个点,形状完整。

步骤 4:实例重组合。将补全后的车辆 A 和车辆 B 点云按照原始场景中的位姿(从分割结果中获取的平移和旋转矩阵)重新组合,形成完整的场景点云。

步骤 5:输出与评估。输出完整场景点云,计算与真实完整点云的 KL 散度。假设真实分布 P 和补全分布 Q 的 KL 散度为 2.1,表明补全质量较高。若将输入点云降采样至 1%(车辆 A 仅 5 个点,车辆 B 仅 3 个点),补全结果的 KL 散度仍小于 0.50,证明方法对稀疏输入的鲁棒性。


实验结果(Results - 效果如何) ​

【实验结果】论文构建了一个真实世界的地下停车场密集 LiDAR 基准数据集,包含多辆车的多视角扫描和人工标注的完整点云。实验采用 KL 散度(Kullback-Leibler Divergence)作为主要定量指标,同时辅以视觉质量对比。对比方法包括代表性的场景级补全基线(如基于深度学习的场景补全网络)。实验结果表明,ZVeC 在定量指标上一致优于场景级基线,补全后的点云与真实完整点云的平均 KL 散度约为 2.1,显著低于基线方法。更重要的是,当输入仅保留原始 LiDAR 测量的 1% 时,补全结果的变化极小(KL 散度小于 0.50),证明了方法在极端稀疏输入下的鲁棒性和几何一致性。视觉对比也显示,ZVeC 生成的车辆形状更加合理,细节更丰富。

实验结果可视化 ​


优势与不足 ​

【优势与不足】 优势:

  • 零样本能力:无需任何配对的不完整-完整点云训练数据,即可实现高质量补全,极大降低了数据采集成本。
  • 实例级分解策略:将场景级补全转化为物体级重建,有效降低了杂乱环境中的重建歧义性,提高了补全精度。
  • 极端稀疏输入下的鲁棒性:即使仅保留 1% 的 LiDAR 测量,补全结果变化极小,证明了方法的几何一致性。
  • 真实基准数据集:构建了地下停车场密集 LiDAR 基准,填补了该领域数据空白。

不足:

  • 依赖语义分割质量:如果实例分割不准确,后续补全会受到严重影响,可能产生错误的物体形状。
  • 计算开销:扩散模型推理速度较慢,可能难以满足实时应用需求。
  • 场景泛化性验证有限:仅在停车场场景验证,未在矿井、隧道等其他地下环境测试。

相关工作 ​

【相关工作】

  • 点云补全(Point Cloud Completion):如 PCN、GRNet 等基于深度学习的补全方法,通常需要大规模配对训练数据,本文以零样本方式解决该问题。
  • 三维扩散模型(3D Diffusion Models):如 Diffusion-SDF、Point-E 等,利用扩散模型生成三维形状,本文将其扩展为条件补全并应用于 LiDAR 点云。
  • 零样本三维重建(Zero-Shot 3D Reconstruction):如基于 NeRF 或高斯泼溅(Gaussian Splatting)的方法,本文结合深度图与三维高斯条件实现零样本补全。
  • 实例级场景理解(Instance-Level Scene Understanding):如 PointGroup、SoftGroup 等实例分割方法,本文利用其输出作为补全的输入。
  • 地下环境感知(Underground Perception):针对地下停车场、矿井等场景的 LiDAR 感知研究,本文提供了新的补全基准和方法。

未来研究方向 ​

【未来方向】

  • 多类别物体补全:当前方法仅针对车辆,未来可扩展到行人、自行车、交通标志等多类别物体,实现通用实例级补全。
  • 实时推理优化:扩散模型推理速度较慢,未来可研究蒸馏、少步采样等技术,将补全时间降至实时水平,满足自动驾驶需求。
  • 跨场景泛化验证:在矿井、隧道、地下仓库等更多地下环境中验证方法的泛化能力,并探索域自适应技术。
  • 与下游任务联合优化:将补全模块与目标检测、路径规划等下游任务联合训练,实现端到端的感知-规划一体化。

一句话总结 ​

【一句话总结】ZVeC 提出零样本实例级点云补全框架,通过分解场景、条件扩散生成与重组合,在极端稀疏输入下实现几何一致的车辆补全。


本解读由 DeepSeek AI 自动生成,仅供参考。

Built with curiosity and a little stardust.