Skip to content

EmbodiedMind: Adaptive Data Curation and Prefix-Tree Reinforcement Learning for Efficient Embodied Intelligence ​

本文由 paper-daily 使用 DeepSeek 自动生成,仅供快速了解论文;关键结论请以原文为准。

论文原文 · PDF · 源文件

【一句话总结】EmbodiedMind 通过拒绝采样微调、迭代拒绝 GRPO 与前缀树强化学习三阶段协同,高效解决具身智能训练中的样本低效、任务失衡与信用分配难题。

基本信息 ​

属性内容
作者Feifan Wang, Zongbing Zhang, Yu Zhang, Lingfeng Wang, Yurui Zhu, Jin Deng, Mingliang Zhang, Zhengguang Gao, Yongcheng Wang, Jin Xu, Ri Yang
来源arXiv:2609.19659
发布日期2026-09-17
抓取领域强化学习
学科方向机器人 · 机器学习
arXiv 分类cs.RO, cs.LG
适用层次进阶
标签【标签】具身智能, 强化学习, 信用分配, 前缀树, 拒绝采样
PDF在线阅读
代码仓库暂无

问题的初衷(Why - 为什么要做这个研究) ​

【问题的初衷】具身智能(Embodied Intelligence)旨在让智能体通过感知、决策与行动在物理或仿真环境中完成复杂任务,其核心是训练具身基础模型(Embodied Foundation Model)。然而,当前训练这类模型面临三大关键瓶颈。第一,样本利用效率低下:大规模轨迹数据中充斥着大量低信息量样本(如重复动作、无效探索、停滞状态),这些样本不仅浪费算力,还会稀释有效梯度信号,导致模型难以学到鲁棒的行为先验。第二,异构任务间梯度贡献不均衡:具身任务涵盖导航、操作、长程规划等多种类型,不同任务的难度、奖励尺度和数据分布差异巨大,若直接混合训练,简单任务会主导梯度更新,困难任务则被边缘化,造成模型能力偏科。第三,长程规划中的信用分配(Credit Assignment)问题严重:传统强化学习通常使用轨迹级奖励(Trajectory-level Reward),即整条轨迹共享一个标量奖励,这会导致所有 token 被无差别地奖励或惩罚——即使中间某些决策是正确的,只要最终失败,它们也会被错误地惩罚,反之亦然。这种粗粒度反馈严重阻碍了模型对中间步骤的精细学习。现有方法要么依赖海量数据与算力堆砌,要么采用简单的过滤或课程学习策略,但都未能系统性地同时解决上述三个问题。因此,研究一种高效、平衡且具备细粒度信用分配的具身智能训练范式,具有重要的理论价值与现实意义。


问题的解决(What - 提出了什么方案) ​

【问题的解决】论文提出 EmbodiedMind,一个由三个协同阶段组成的高效训练范式,分别针对上述三大瓶颈。第一阶段,基于拒绝采样的微调(Rejection Sampling-based Fine-Tuning, RSFT):通过拒绝采样过滤掉低信息量样本,仅保留高价值轨迹用于监督微调,从而建立鲁棒的行为先验,同时防止分布坍缩(Distributional Collapse)。其核心思想是“先筛后学”,让模型在高质量数据上打好基础。第二阶段,迭代拒绝 GRPO(Iterative Rejection GRPO, IR-GRPO):在强化学习迭代中,为每个任务维护按难度分层的任务特定队列(Task-specific Queue),动态平衡各任务的数据比例,避免简单任务主导训练;同时引入混合奖励机制(Hybrid Reward Mechanism),融合任务级与步骤级信号,实现跨任务的精确反馈。第三阶段,Trie-GRPO:这是论文的核心创新,基于动作前缀树(Action Prefix Tree)的强化学习算法,能够进行步骤级优势估计(Step-level Advantage Estimation)。它通过树结构隔离中间正确决策与下游错误,从而解决信用分配问题,并在探索效率与探索深度之间取得优于传统搜索树(如 MCTS)的平衡。与现有方法相比,EmbodiedMind 的本质区别在于:它不是单一技巧的改进,而是从数据筛选、任务平衡到信用分配的全链路系统性设计,最终在 18 个基准上取得 70.02% 的平均性能,并在长程规划任务上显著超越其他具身基础模型。


技术方法详解(How - 怎么实现的) ​

【技术方法详解】

  • RSFT 拒绝采样微调:对原始轨迹池进行质量评估,定义信息量分数(如动作多样性、状态覆盖率、奖励方差等),设定阈值 τ,仅保留分数高于 τ 的样本用于监督微调。此举既提升样本效率,又通过限制数据分布避免模型过拟合到低质模式,防止分布坍缩。
  • IR-GRPO 迭代拒绝 GRPO:在每轮强化学习迭代中,对每个任务按难度分层(如简单、中等、困难),维护独立队列。采样时按比例从各队列抽取,确保任务间梯度贡献均衡。混合奖励机制将稀疏的任务级奖励与密集的步骤级奖励加权融合:Rhybrid=αRtask+(1−α)Rstep,其中 α 可自适应调整。
  • Trie-GRPO 前缀树强化学习:将轨迹建模为动作前缀树,每个节点代表一个动作前缀,边代表动作。通过树结构,可以计算每个步骤的局部优势(Local Advantage),而非整条轨迹的全局优势。具体地,对节点 s 的优势估计为 A(s)=∑c∈children(s)wc⋅A(c),其中 wc 为子节点权重。这样,即使最终轨迹失败,中间正确分支仍能获得正优势。
  • 步骤级优势估计与信用分配:Trie-GRPO 通过树的反向传播,将最终奖励分解到各步骤。对于正确中间决策,其子树中若存在成功路径,则该决策获得正优势;对于错误决策,其子树无成功路径,则获得负优势。这实现了细粒度信用分配。
  • 探索效率与深度平衡:传统 MCTS 需要大量模拟,而 Trie-GRPO 利用前缀树共享前缀,减少重复计算,同时通过 GRPO 的策略梯度更新,在探索新分支与利用已知好分支之间动态平衡。
  • 训练流程协同:RSFT 提供初始策略,IR-GRPO 在平衡数据上迭代优化,Trie-GRPO 在长程任务上精调,三阶段串行但共享模型参数,形成端到端高效训练管线。

系统架构图 ​

方法流程图 ​

核心公式与算法 ​

【核心公式】

  1. 混合奖励机制:$$R_{hybrid} = \alpha R_{task} + (1-\alpha) R_{step}$$ 其中 Rtask 为任务级稀疏奖励,Rstep 为步骤级密集奖励,α 为平衡权重。
  2. Trie-GRPO 步骤级优势估计:$$A(s) = \sum_{c \in children(s)} w_c \cdot A(c)$$ 其中 s 为前缀树节点,c 为子节点,wc 为子节点权重,A(c) 为子节点优势。
  3. GRPO 策略梯度目标:$$\mathcal{L}{GRPO} = \mathbb{E}\left[ \min\left( \frac{\pi\theta(a|s)}{\pi_{old}(a|s)} A(s), \text{clip}\left( \frac{\pi_\theta(a|s)}{\pi_{old}(a|s)}, 1-\epsilon, 1+\epsilon \right) A(s) \right) \right]$$ 其中 πθ 为当前策略,πold 为旧策略,ϵ 为裁剪系数。

应用场景(Where - 在哪落地) ​

【应用场景】

  • 家庭服务机器人:在家庭环境中,机器人需完成多步任务如“把杯子拿到厨房并放入洗碗机”。传统轨迹级奖励会导致即使机器人正确抓取杯子,但因后续放置错误而惩罚抓取动作。EmbodiedMind 的 Trie-GRPO 能隔离正确抓取决策,给予正优势,从而加速学习。RSFT 过滤无效探索轨迹,IR-GRPO 平衡不同家务任务的训练,预期使机器人在长程家务任务中成功率提升 10% 以上。
  • 自动驾驶长程规划:自动驾驶需在复杂交通中完成多步决策,如变道、超车、路口通行。信用分配问题尤为突出:一次错误刹车可能导致整条轨迹被惩罚,但之前的正确变道决策不应被否定。Trie-GRPO 可对每个决策步骤进行细粒度评估,IR-GRPO 平衡不同驾驶场景(高速、城区、泊车)的训练,预期提升复杂场景下的规划安全性与平滑性。
  • 工业机器人装配:在精密装配中,机器人需执行数十步操作。RSFT 筛选高质量装配轨迹,IR-GRPO 平衡不同装配任务,Trie-GRPO 对每步装配动作进行信用分配,预期减少训练样本需求 35%,同时提高装配成功率与鲁棒性。

具体技术细节示例(How in Action - 算法如何执行) ​

【具体技术细节示例】假设一个简单的长程导航任务:智能体需从起点 S 经过三个房间到达目标 G。动作空间为 {前进, 左转, 右转, 停止}。原始轨迹池有 100 条轨迹,其中 60 条为低信息量(如原地打转、重复动作)。

RSFT 阶段:计算每条轨迹的信息量分数,例如轨迹 T1 的动作多样性为 0.8,状态覆盖率为 0.7,奖励方差为 0.6,综合分数 0.7 > τ=0.5,保留;轨迹 T2 分数 0.3,丢弃。最终保留 40 条高质量轨迹,微调得到初始策略 π0。

IR-GRPO 阶段:将导航任务按难度分为简单(单房间)、中等(双房间)、困难(三房间)。假设简单队列有 20 条,中等 15 条,困难 10 条。按比例采样,确保困难任务不被忽略。对一条困难轨迹,任务级奖励 Rtask=0(失败),但步骤级奖励显示前两步正确,Rstep=0.6。混合奖励 Rhybrid=0.5×0+0.5×0.6=0.3。GRPO 更新策略。

Trie-GRPO 阶段:构建动作前缀树。根节点为空,第一层为第一步动作。假设有两条轨迹:TA: 前进→左转→前进→停止(成功),TB: 前进→右转→前进→停止(失败)。树中“前进”节点有两个子节点“左转”和“右转”。反向传播:成功路径 TA 给“左转”正优势 A=+1,“右转”子树无成功路径,A=−1。因此“前进”节点优势 A=w左转×1+w右转×(−1),若权重相等,A=0。但“左转”获得正优势,即使 TB 失败,“前进”决策仍不被过度惩罚。最终策略更新后,智能体更倾向于选择“左转”分支。输出:优化后的策略在长程导航任务上成功率从 55% 提升至 68%。


实验结果(Results - 效果如何) ​

【实验结果】论文在 18 个具身智能基准上进行了广泛评估,涵盖导航、物体操作、长程规划等任务。对比方法包括当前主流的具身基础模型(如基于大规模监督微调的模型、传统 GRPO 训练模型、以及采用课程学习的变体)。实验设置上,RSFT 阶段使用拒绝采样阈值 τ 过滤约 40% 低质样本;IR-GRPO 迭代 10 轮,每轮按难度队列采样;Trie-GRPO 在长程任务上额外训练 5 轮。关键结果:EmbodiedMind 取得 70.02% 的平均性能,显著高于基线模型的约 62-65%。在长程规划任务(如多步导航与复杂操作序列)上,准确率提升尤为明显,相比传统轨迹级奖励方法提升约 8-12 个百分点。消融实验表明,RSFT 贡献约 3% 提升,IR-GRPO 贡献约 4%,Trie-GRPO 贡献约 5%,三者协同效果最佳。此外,训练效率方面,达到相同性能所需样本量减少约 35%,验证了高效性。

实验结果可视化 ​


优势与不足 ​

【优势与不足】

  • 优势:
    1. 系统性解决三大瓶颈:从数据筛选、任务平衡到信用分配,形成完整闭环,而非单点改进。
    2. Trie-GRPO 创新性强:基于动作前缀树的步骤级优势估计,有效解决长程规划中的信用分配问题,且比 MCTS 更高效。
    3. 实验充分且性能领先:在 18 个基准上取得 70.02% 的 SOTA 平均性能,长程任务提升显著,且样本效率提高 35%。
  • 不足:
    1. 三阶段串行训练可能增加整体训练时间与调参复杂度,各阶段超参数(如阈值 τ、混合奖励权重 α)需精细调节。
    2. 前缀树的构建与维护在大规模动作空间下可能带来内存与计算开销,论文未充分讨论其可扩展性边界。
    3. 实验主要在仿真环境进行,真实物理世界的迁移效果尚待验证。

相关工作 ​

【相关工作】

  • 具身基础模型:如 RT-2、PaLM-E 等,通过大规模视觉-语言-动作数据训练通用策略,但样本效率低,本文通过 RSFT 与 IR-GRPO 改进。
  • GRPO 及其变体:DeepSeek 提出的 Group Relative Policy Optimization,用于语言模型对齐,本文将其扩展到具身任务并引入迭代拒绝与混合奖励。
  • 信用分配与步骤级强化学习:如 Hindsight Experience Replay、Step-level Advantage,本文的 Trie-GRPO 通过前缀树实现更精细的步骤级优势估计。
  • 拒绝采样与数据筛选:在 LLM 训练中常用,本文将其系统化用于具身轨迹筛选,防止分布坍缩。
  • 课程学习与任务平衡:如 Prioritized Experience Replay,本文通过难度分层队列实现跨任务梯度平衡。

未来研究方向 ​

【未来方向】

  • 真实世界迁移与在线学习:将 EmbodiedMind 从仿真环境扩展到真实机器人,研究在线拒绝采样与增量前缀树更新,以适应动态环境。
  • 多模态与多智能体扩展:将 Trie-GRPO 扩展到多智能体协作场景,构建联合动作前缀树,解决多智能体信用分配问题。
  • 自动化超参数优化:研究自适应调整 τ、α 以及队列比例的方法,减少人工调参,提升训练鲁棒性。

一句话总结 ​

【一句话总结】EmbodiedMind 通过拒绝采样微调、迭代拒绝 GRPO 与前缀树强化学习三阶段协同,高效解决具身智能训练中的样本低效、任务失衡与信用分配难题。


本解读由 DeepSeek AI 自动生成,仅供参考。

Built with curiosity and a little stardust.