Towards Practical Compression of 3D Gaussian Splatting
本文由 paper-daily 使用 DeepSeek 自动生成,仅供快速了解论文;关键结论请以原文为准。
【一句话总结】COSA-GS 通过锚点因果因子分解与整数推断,实现了简单、快速且跨平台一致的 3DGS 压缩,达到 SOTA 性能。
基本信息
| 属性 | 内容 |
|---|---|
| 作者 | Pengpeng Yu, Yueru Chen, Fei Song, Tai Qin, Qi Zhang, Jing Wang, Yulan Guo |
| 来源 | arXiv:2609.30245 |
| 发布日期 | 2026-09-24 |
| 抓取领域 | LLM推理 · 模型压缩 |
| 学科方向 | 计算机视觉 |
| arXiv 分类 | cs.CV |
| 适用层次 | 进阶 |
| 标签 | 【标签】3D高斯泼溅, 模型压缩, 熵编码, 量化感知训练, 跨平台一致性 |
| 在线阅读 | |
| 代码仓库 | 暂无 |
问题的初衷(Why - 为什么要做这个研究)
【问题的初衷】3D高斯泼溅(3D Gaussian Splatting, 3DGS)作为一种新兴的三维场景表示与渲染技术,能够实现高质量的新视角合成(Novel View Synthesis),在虚拟现实、自动驾驶仿真、数字孪生等领域展现出巨大潜力。然而,3DGS 的核心问题在于其存储开销极为庞大:一个典型场景往往需要数百万个高斯椭球(Gaussian),每个高斯包含位置、协方差、不透明度、球谐系数(Spherical Harmonics, SH)等数十个浮点参数,导致单个场景的模型文件动辄数百 MB 甚至超过 1 GB,严重阻碍了其在移动端、Web 端和流媒体场景中的实际部署。现有的压缩方法(如基于上下文建模的熵编码方案)通常依赖对不规则三维表示进行空间上下文聚合(Spatial Context Aggregation),例如通过 KNN 近邻搜索或体素化来构建上下文,这不仅显著增加了训练与编码的复杂度,还引入了额外的计算开销。更严重的是,这些方法在上下文推断过程中使用浮点运算,由于不同硬件平台(如 x86 与 ARM、GPU 与 CPU)在浮点舍入、FMA 指令、超越函数实现上的差异,会导致熵解码(Entropy Decoding)时符号不一致,从而引发跨平台解码失败。因此,如何在保持高压缩率的同时,实现简单、快速且跨平台比特精确(Bit-exact)一致的 3DGS 压缩,成为一个亟待解决的实用化难题。
问题的解决(What - 提出了什么方案)
【问题的解决】针对上述挑战,论文提出了 COSA-GS(Context without Spatial Aggregation for Gaussian Splatting),其核心思路是摒弃传统的空间聚合式上下文建模,转而采用基于锚点(Anchor)的因果因子分解(Causal Factorization)来构建上下文。具体而言,COSA-GS 首先利用每个锚点的三维坐标直接推导出几何上下文(Geometry Context),该上下文不依赖任何近邻搜索或空间聚合操作,从而大幅降低复杂度。随后,论文引入一个紧凑的可学习锚点隐变量(Anchor Latent),并将其与几何上下文融合,形成锚点上下文(Anchor Context),用于后续高斯属性的熵编码。这种上下文模型仅由线性变换和激活函数构成,架构极为简洁。为提升压缩效率,论文采用率失真优化(Rate-Distortion Optimization)联合自适应高斯剪枝(Adaptive Gaussian Pruning)进行训练,在压缩率与渲染质量之间取得平衡。此外,为实现跨平台比特精确一致性,论文进一步设计了量化感知训练(Quantization-Aware Training, QAT)与整数推断(Integer Inference)机制,确保熵解码符号在不同平台上完全一致。与现有方法相比,COSA-GS 的本质区别在于:不依赖空间聚合、不依赖浮点上下文推断,从而在保持 SOTA 压缩性能的同时,实现了快速且一致的跨平台解码,为 3DGS 的实用化压缩提供了简洁而有效的框架。
技术方法详解(How - 怎么实现的)
【技术方法详解】COSA-GS 的技术方法可从以下几个关键方面进行深入剖析:
锚点式因果因子分解(Anchor-wise Causal Factorization):论文将每个锚点视为独立的编码单元,利用锚点坐标
通过一个轻量级网络生成几何上下文 。该过程不涉及任何近邻查询或空间聚合,避免了传统方法中 KNN 搜索带来的 或 复杂度。因果性体现在:锚点上下文的构建仅依赖自身坐标,不依赖其他锚点的属性,从而天然支持并行编码。 锚点隐变量与上下文融合:每个锚点关联一个可学习的隐变量
,该隐变量通过训练学习得到,用于捕获锚点级别的统计规律。几何上下文 与隐变量 通过线性变换与激活函数融合,形成锚点上下文 ,其中 为激活函数。该上下文随后用于预测高斯属性的概率分布,驱动熵编码。 率失真优化与自适应高斯剪枝:训练目标为率失真损失
,其中 为渲染失真(如 或 损失), 为码率估计, 控制权衡。自适应高斯剪枝根据高斯的重要性动态移除冗余高斯,进一步降低存储与码率。 量化感知训练(QAT)与整数推断:为消除浮点推断的跨平台不一致性,论文在训练阶段模拟量化操作,将上下文模型的权重与激活量化为整数。推断阶段完全使用整数运算,确保熵解码符号在不同平台上比特精确一致。
简洁的上下文模型架构:整个上下文模型仅由线性层和激活函数组成,不含卷积、注意力或循环结构,参数量极小,推断速度快,适合实时解码场景。
熵编码与解码流程:高斯属性(如位置、协方差、不透明度、SH 系数)在锚点上下文的条件下,通过算术编码(Arithmetic Coding)进行压缩。解码端使用相同的整数上下文模型,保证符号一致性。
系统架构图
方法流程图
核心公式与算法
【核心公式】
- 锚点上下文融合公式:
其中
- 率失真优化损失:
其中
- 量化感知训练中的量化函数:
其中
应用场景(Where - 在哪落地)
【应用场景】
移动端与 Web 端三维展示:在电商、文旅、房地产等领域,用户希望通过手机或浏览器实时查看三维场景。COSA-GS 可将 3DGS 模型压缩至数十 MB,并实现快速跨平台解码,使移动端流畅加载与渲染成为可能。预期效果:加载时间从数十秒降至数秒,渲染帧率稳定在 30 FPS 以上。
自动驾驶仿真与数字孪生:自动驾驶需要大规模三维场景重建用于仿真测试。COSA-GS 的高压缩率可大幅降低存储与传输成本,跨平台一致性确保仿真系统在不同硬件上解码结果一致,避免因平台差异导致的仿真偏差。预期效果:场景存储成本降低 90% 以上,仿真一致性显著提升。
云游戏与流媒体三维内容:云游戏平台需要实时传输三维场景。COSA-GS 的快速解码与高压缩率可降低带宽需求,提升用户体验。预期效果:带宽占用降低 80%,端到端延迟减少,支持更多并发用户。
具体技术细节示例(How in Action - 算法如何执行)
【具体技术细节示例】假设我们有一个包含 3 个锚点的简化 3DGS 场景,锚点坐标分别为
步骤 1:生成几何上下文。对锚点 1:
步骤 2:融合上下文。设融合权重
步骤 3:熵编码。假设锚点 1 的不透明度属性为
步骤 4:跨平台一致性验证。在 x86 与 ARM 平台上,由于上下文模型已量化为整数,
实验结果(Results - 效果如何)
【实验结果】论文在多个标准 3DGS 数据集上进行了广泛实验,包括 Mip-NeRF 360、Tanks and Temples、Deep Blending 等常用基准。对比方法涵盖了原始 3DGS 以及多种主流压缩方案,如基于上下文建模的 C3DGS、Scaffold-GS、HAC 等。实验采用 PSNR、SSIM、LPIPS 等渲染质量指标,以及模型大小、码率、解码时间等压缩与效率指标。结果表明,COSA-GS 在压缩率上达到 SOTA 水平,模型大小相比原始 3DGS 减少数十倍,同时在 PSNR 上保持甚至超越原始 3DGS 的渲染质量。例如,在 Mip-NeRF 360 数据集上,COSA-GS 将模型压缩至约 10-20 MB,PSNR 仍保持在 27 dB 以上,优于多数对比方法。更重要的是,COSA-GS 的解码速度显著快于基于空间聚合的方法,且在不同平台(如 x86 CPU、ARM CPU、GPU)上实现了比特精确一致的解码结果,验证了其跨平台实用性。消融实验进一步表明,锚点因果因子分解、量化感知训练和自适应剪枝均对最终性能有显著贡献。
实验结果可视化
优势与不足
【优势与不足】
优势:
- 简洁高效:上下文模型仅由线性变换和激活函数构成,避免了空间聚合与复杂网络结构,训练与编码复杂度大幅降低。
- 跨平台一致性:通过量化感知训练与整数推断,实现了熵解码符号的比特精确一致,解决了浮点推断导致的跨平台解码失败问题。
- 压缩性能优异:在多个基准数据集上达到 SOTA 压缩率,同时保持高渲染质量,模型大小显著减小。
- 实用性强:解码速度快,适合移动端、Web 端等资源受限场景,代码开源,便于复现与部署。
不足:
- 锚点隐变量依赖训练:可学习锚点隐变量需要针对每个场景单独训练,可能增加训练时间与存储开销。
- 几何上下文表达能力有限:仅依赖锚点坐标生成几何上下文,可能无法充分捕获复杂场景中的高阶空间相关性,在极端复杂场景下压缩率可能受限。
- 量化误差影响:量化感知训练虽保证一致性,但量化本身可能引入一定精度损失,需在率失真权衡中谨慎调参。
相关工作
【相关工作】
- 3D Gaussian Splatting(3DGS):Kerbl 等人提出的原始 3DGS 方法,实现了实时高质量渲染,但存储开销大,是本文压缩的直接对象。
- C3DGS:基于上下文建模的 3DGS 压缩方法,通过空间聚合构建上下文,压缩率高但复杂度大,且存在浮点推断不一致问题。
- Scaffold-GS:引入锚点结构组织高斯,提升渲染效率与压缩潜力,本文的锚点思想与之相关但上下文构建方式不同。
- HAC:基于哈希网格的上下文建模压缩方法,依赖空间聚合,复杂度较高。
- 量化感知训练与整数推断:在神经网络压缩与推理领域广泛应用,本文将其引入 3DGS 上下文模型,解决跨平台一致性问题。
未来研究方向
【未来方向】
- 自适应锚点隐变量压缩:当前锚点隐变量需针对每个场景训练与存储,未来可研究隐变量的跨场景共享或元学习(Meta-Learning)方法,进一步降低存储与训练成本。
- 更丰富的几何上下文建模:在保持无空间聚合的前提下,探索更强大的几何特征提取方式,如基于坐标的隐式神经表示(Implicit Neural Representation),以提升复杂场景的压缩率。
- 端到端整数训练与硬件协同设计:进一步将整数推断扩展到整个 3DGS 渲染管线,结合专用硬件加速器,实现全整数、低功耗的实时三维渲染与解码。
一句话总结
【一句话总结】COSA-GS 通过锚点因果因子分解与整数推断,实现了简单、快速且跨平台一致的 3DGS 压缩,达到 SOTA 性能。
本解读由 DeepSeek AI 自动生成,仅供参考。