Skip to content

DirtyMoCap: Robust Motion Capture from Unconstrained Markers ​

本文由 paper-daily 使用 DeepSeek 自动生成,仅供快速了解论文;关键结论请以原文为准。

论文原文 · PDF · 源文件

【一句话总结】DirtyMoCap 通过代理锚点和可微分高斯-牛顿求解器,实现了从任意脏标记数据中鲁棒重建人体运动。

基本信息 ​

属性内容
作者Long Wang, Shuting Zhao, Shen Yan, Siyuan Yu, Xiaoben Li, Zeyu Cai, Yumeng Hou, Yuliang Xiu
来源arXiv:2609.19927
发布日期2026-09-17
抓取领域强化学习
学科方向计算机视觉
arXiv 分类cs.CV
适用层次进阶
标签【标签】动作捕捉, 鲁棒优化, 可微分求解器, 参数化人体模型, 代理锚点
PDF在线阅读
代码仓库暂无

问题的初衷(Why - 为什么要做这个研究) ​

【问题的初衷】光学动作捕捉(Optical Motion Capture)长期以来是获取高保真人体运动数据的主流技术,广泛应用于影视制作、游戏动画、体育分析、医疗康复等领域。然而,传统光学动捕系统对标记点(Marker)的布局有着极为严格的要求:需要预先定义固定的标记点数量和位置,并且要求追踪系统输出干净、有序、完整的轨迹。在实际应用中,由于遮挡、标记点脱落、传感器噪声、不同演员体型差异以及临时搭建的动捕环境等因素,追踪系统往往输出的是无约束的标记点数据——即稀疏、含噪、无序的点云,且其配置(数量、位置)未知或不断变化。这种"脏"标记数据与参数化人体模型(如 SMPL-H)之间存在着巨大的鸿沟:现有方法通常针对特定的标记布局训练专用模型,一旦布局改变或标记点缺失,性能便急剧下降。因此,如何构建一个鲁棒的、不依赖特定标记布局的动作捕捉框架,能够从任意配置的脏标记数据中恢复出高质量的人体运动,成为了一个亟待解决的关键问题。这一问题的解决将极大降低动捕技术的使用门槛,使得在非受控环境下也能获取高质量的人体运动数据。


问题的解决(What - 提出了什么方案) ​

【问题的解决】DirtyMoCap 提出了一个鲁棒的、无需标记布局约束的动作捕捉框架,其核心思想是引入"代理锚点"(Proxy Anchors)作为中间表示。这些代理锚点由骨骼关节(Skeletal Joints)和身体表面点(Body Surface Points)组成,构成了一个固定数量的、稳定的中间表示层。该框架首先通过一个循环滑动窗口架构(Recurrent Sliding-Window Architecture)对代理锚点进行初始化和长序列追踪,从而将无序、含噪的标记点观测映射到这些稳定的锚点上。随后,一个自定义的可微分高斯-牛顿求解器(Differentiable Gauss-Newton Solver)将 SMPL-H 模型拟合到追踪到的锚点上,恢复出全身姿态、平移和体型参数。与现有方法的本质区别在于:第一,DirtyMoCap 不依赖于任何特定的标记布局,单一训练模型即可泛化到任意配置;第二,通过显式推导几何残差,求解器能够端到端地学习自适应观测置信度、平滑度和先验权重,从而动态适应输入数据的可靠性;第三,自定义 CUDA 求解器实现了高达 100 倍的加速。这种方法从根本上解耦了原始标记观测与人体模型拟合之间的关系,使得系统能够在稀疏、噪声、无序的标记配置下依然保持鲁棒性。


技术方法详解(How - 怎么实现的) ​

【技术方法详解】

  • 代理锚点表示(Proxy Anchor Representation):定义一组固定的代理锚点,包括骨骼关节和身体表面点。这些锚点作为从无序标记观测到参数化人体模型之间的稳定中间表示。锚点的数量固定,不随输入标记的数量和配置变化。
  • 循环滑动窗口追踪(Recurrent Sliding-Window Tracking):采用循环神经网络架构,在滑动窗口内对代理锚点进行初始化和追踪。该模块负责将每一帧的无序标记点云映射到代理锚点上,并利用时序信息保持追踪的连续性和稳定性。
  • 可微分高斯-牛顿求解器(Differentiable Gauss-Newton Solver):设计了一个自定义的可微分优化求解器,将 SMPL-H 模型拟合到追踪到的代理锚点。求解器显式推导几何残差,包括观测残差、平滑度残差和先验残差。
  • 自适应权重学习(Adaptive Weight Learning):通过端到端训练,求解器学习自适应的观测置信度权重、平滑度权重和先验权重。这些权重能够根据输入数据的可靠性动态调整,使得系统在噪声大或标记稀疏时自动降低不可靠观测的影响。
  • CUDA 加速实现:自定义 CUDA 求解器针对高斯-牛顿优化过程进行了并行化设计,相比标准 PyTorch 实现实现了高达 100 倍的加速,使得实时或近实时的动作捕捉成为可能。
  • SMPL-H 模型拟合:最终输出为 SMPL-H 参数化人体模型的全身姿态参数、平移参数和体型参数,可直接用于动画驱动、运动分析等下游任务。

系统架构图 ​

方法流程图 ​

核心公式与算法 ​

【核心公式】

  1. 高斯-牛顿优化目标函数:
minθ,β,t∑iwi∥π(SMPL-H(θ,β))−ai∥2+λsRs(θ)+λpRp(θ,β)

其中 θ 为姿态参数,β 为体型参数,t 为平移,wi 为自适应观测权重,ai 为代理锚点,Rs 为平滑度正则项,Rp 为先验正则项。

  1. 自适应权重学习:
wi=σ(fMLP(∥ri∥,featuresi))

其中 ri 为观测残差,σ 为 sigmoid 函数,fMLP 为多层感知机,用于根据残差和特征动态预测置信度。

  1. 代理锚点追踪的循环更新:
at=GRU(at−1,Encoder(Pt))

其中 Pt 为第 t 帧的标记点云,Encoder 为点云编码器,GRU 为门控循环单元,at 为第 t 帧的代理锚点状态。


应用场景(Where - 在哪落地) ​

【应用场景】

  1. 影视与游戏动画制作:在影视和游戏制作中,演员通常需要穿着带有标记点的动捕服进行表演。然而,由于动作剧烈或服装遮挡,标记点经常脱落或移位,导致追踪数据出现缺失和噪声。DirtyMoCap 可以直接处理这些"脏"标记数据,无需重新拍摄或手动修复,大幅提高制作效率。预期效果是减少后期清理数据的时间成本,同时保持高保真的运动重建质量。

  2. 体育科学与运动分析:在体育训练中,运动员的动作捕捉对于技术分析和伤病预防至关重要。但传统动捕系统需要复杂的标定和固定的标记布局,难以在户外或非标准场地使用。DirtyMoCap 的鲁棒性使其能够适应不同的标记配置,甚至可以使用临时粘贴的标记点。预期效果是使得体育科学家能够在更自然的环境下采集运动数据,并获得准确的关节角度和运动轨迹分析。

  3. 非物质文化遗产数字化保护:论文中展示了将 DirtyMoCap 应用于中国传统武术的动捕记录。武术动作复杂、快速,且传统动捕设备在非专业场地中容易产生脏数据。DirtyMoCap 能够从这些异构原始数据中重建出时间连贯的 SMPL-H 运动序列,为武术的数字化保存和传承提供了技术手段。预期效果是建立高质量的武术运动数据库,支持虚拟教学、动作对比分析等应用。


具体技术细节示例(How in Action - 算法如何执行) ​

【具体技术细节示例】假设我们有一个包含 10 个标记点的脏标记点云序列,标记点位置如下(单位:米):

帧 t=1:P1={(0.1,1.2,0.3),(0.2,1.1,0.4),…}(10 个点,无序)

步骤 1:代理锚点初始化 循环滑动窗口追踪模块接收 P1,通过点云编码器提取特征,输出初始代理锚点 a1。假设代理锚点包含 20 个骨骼关节和 50 个表面点,共 70 个锚点。初始时,锚点位置根据 SMPL-H 的默认模板和输入点云的粗略对齐确定。

步骤 2:代理锚点追踪 对于帧 t=2,输入 P2,GRU 更新:a2=GRU(a1,Encoder(P2))。追踪过程中,每个锚点通过注意力机制与输入标记点建立对应关系。例如,锚点 a1(1)(左手腕关节)可能对应 P1 中的第 3 个点,权重为 0.8;对应第 7 个点,权重为 0.2。

步骤 3:可微分高斯-牛顿求解 将追踪到的锚点序列 {a1,a2,…,aT} 输入求解器。以帧 t=1 为例,计算观测残差:ri=π(SMPL-H(θ,β))−ai。假设初始 θ 为默认姿态,β 为平均体型。计算雅可比矩阵 J,求解增量 Δθ=−(JTWJ)−1JTWr,其中 W 为自适应权重矩阵。

步骤 4:自适应权重学习 对于每个锚点,MLP 根据残差大小和特征预测权重。例如,左手腕锚点的残差为 0.05m,MLP 输出权重 0.9;而右脚踝锚点的残差为 0.15m(可能由于遮挡导致),MLP 输出权重 0.3,降低其影响。

步骤 5:迭代优化 重复步骤 3-4 直到收敛。最终输出帧 t=1 的 SMPL-H 参数:姿态 θ(72 维),体型 β(10 维),平移 t(3 维)。重建的关节位置与真实值的误差从初始的 5cm 降低到 1.5cm。

输出结果:时间连贯的 SMPL-H 运动序列,可用于动画驱动或运动分析。


实验结果(Results - 效果如何) ​

【实验结果】论文在多种噪声标记配置下进行了广泛的实验。实验设置包括不同数量的标记点、不同程度的噪声、以及不同的标记布局。基准数据集涵盖了多种人体运动类型。对比方法包括针对特定配置训练的最先进基线方法。实验结果表明,DirtyMoCap 在关节重建精度和顶点重建精度上均持续优于这些基线方法。具体而言,在关节位置误差和顶点位置误差指标上,DirtyMoCap 取得了显著的性能提升。此外,自定义 CUDA 求解器相比标准 PyTorch 实现实现了高达 100 倍的加速。论文还将 DirtyMoCap 应用于中国传统武术的异构原始光学动捕记录,生成了一个时间连贯的 SMPL-H 重建的功夫运动数据集,验证了其在实际应用中的有效性。

实验结果可视化 ​


优势与不足 ​

【优势与不足】

优势:

  • 鲁棒性强:不依赖特定标记布局,单一模型可泛化到任意配置的标记数据,包括稀疏、噪声、无序的点云。
  • 端到端自适应:通过可微分求解器学习自适应权重,能够根据输入数据可靠性动态调整,无需手动调参。
  • 高效性:自定义 CUDA 求解器实现高达 100 倍加速,具有实际部署潜力。
  • 实际应用验证:成功应用于中国传统武术动捕数据,生成了高质量的运动数据集。

不足:

  • 对极端稀疏标记的鲁棒性边界未充分探讨:当标记点数量极少时,代理锚点的初始化可能不稳定。
  • 依赖 SMPL-H 模型:对于非标准体型或穿着特殊服装的演员,模型拟合可能存在偏差。
  • 循环滑动窗口架构的长期漂移问题:在超长序列中,追踪误差可能累积。
  • 实验主要在光学动捕数据上进行,对于其他模态(如 IMU、视觉)的泛化能力未知。

相关工作 ​

【相关工作】

  • SMPL/SMPL-H 参数化人体模型:DirtyMoCap 使用 SMPL-H 作为最终的人体表示,相关工作包括 SMPL、SMPL-X 等参数化模型的设计与应用。
  • 基于标记的动作捕捉:传统方法如 Vicon 系统依赖固定标记布局,近期工作尝试从稀疏标记重建人体运动,但通常针对特定配置。
  • 可微分优化与物理求解器:DirtyMoCap 的可微分高斯-牛顿求解器与可微分物理、可微分渲染等领域的工作相关,强调端到端学习优化参数。
  • 无标记动作捕捉:基于视觉的方法如 VideoMocap、FrankMocap 等从视频中重建人体运动,但与基于标记的方法在精度和鲁棒性上各有优劣。
  • 鲁棒点云配准与追踪:代理锚点的追踪与点云配准、非刚性配准等领域相关,涉及无序点云的对应关系建立。

未来研究方向 ​

【未来方向】

  • 多模态融合:将 DirtyMoCap 扩展到融合 IMU、视觉等多模态数据,进一步提高在极端遮挡或标记点极少情况下的鲁棒性。
  • 实时在线优化:进一步优化 CUDA 求解器,实现真正的实时在线动作捕捉,并探索在移动设备上的部署。
  • 自适应锚点数量:研究根据输入标记点的数量和分布动态调整代理锚点数量的机制,以在稀疏和密集场景下都达到最优性能。
  • 泛化到非标准体型:探索对非 SMPL-H 标准体型(如儿童、特殊服装)的适应方法,减少模型偏差。

一句话总结 ​

【一句话总结】DirtyMoCap 通过代理锚点和可微分高斯-牛顿求解器,实现了从任意脏标记数据中鲁棒重建人体运动。


本解读由 DeepSeek AI 自动生成,仅供参考。

Built with curiosity and a little stardust.