EmbodiedMind: Adaptive Data Curation and Prefix-Tree Reinforcement Learning for Efficient Embodied Intelligence
本文由 paper-daily 使用 DeepSeek 自动生成,仅供快速了解论文;关键结论请以原文为准。
【一句话总结】EmbodiedMind 通过拒绝采样微调、迭代拒绝 GRPO 与前缀树强化学习三阶段协同,高效解决具身智能训练中的样本低效、任务失衡与信用分配难题。
基本信息
| 属性 | 内容 |
|---|---|
| 作者 | Feifan Wang, Zongbing Zhang, Yu Zhang, Lingfeng Wang, Yurui Zhu, Jin Deng, Mingliang Zhang, Zhengguang Gao, Yongcheng Wang, Jin Xu, Ri Yang |
| 来源 | arXiv:2609.19659 |
| 发布日期 | 2026-09-17 |
| 抓取领域 | 强化学习 |
| 学科方向 | 机器人 · 机器学习 |
| arXiv 分类 | cs.RO, cs.LG |
| 适用层次 | 进阶 |
| 标签 | 【标签】具身智能, 强化学习, 信用分配, 前缀树, 拒绝采样 |
| 在线阅读 | |
| 代码仓库 | 暂无 |
问题的初衷(Why - 为什么要做这个研究)
【问题的初衷】具身智能(Embodied Intelligence)旨在让智能体通过感知、决策与行动在物理或仿真环境中完成复杂任务,其核心是训练具身基础模型(Embodied Foundation Model)。然而,当前训练这类模型面临三大关键瓶颈。第一,样本利用效率低下:大规模轨迹数据中充斥着大量低信息量样本(如重复动作、无效探索、停滞状态),这些样本不仅浪费算力,还会稀释有效梯度信号,导致模型难以学到鲁棒的行为先验。第二,异构任务间梯度贡献不均衡:具身任务涵盖导航、操作、长程规划等多种类型,不同任务的难度、奖励尺度和数据分布差异巨大,若直接混合训练,简单任务会主导梯度更新,困难任务则被边缘化,造成模型能力偏科。第三,长程规划中的信用分配(Credit Assignment)问题严重:传统强化学习通常使用轨迹级奖励(Trajectory-level Reward),即整条轨迹共享一个标量奖励,这会导致所有 token 被无差别地奖励或惩罚——即使中间某些决策是正确的,只要最终失败,它们也会被错误地惩罚,反之亦然。这种粗粒度反馈严重阻碍了模型对中间步骤的精细学习。现有方法要么依赖海量数据与算力堆砌,要么采用简单的过滤或课程学习策略,但都未能系统性地同时解决上述三个问题。因此,研究一种高效、平衡且具备细粒度信用分配的具身智能训练范式,具有重要的理论价值与现实意义。
问题的解决(What - 提出了什么方案)
【问题的解决】论文提出 EmbodiedMind,一个由三个协同阶段组成的高效训练范式,分别针对上述三大瓶颈。第一阶段,基于拒绝采样的微调(Rejection Sampling-based Fine-Tuning, RSFT):通过拒绝采样过滤掉低信息量样本,仅保留高价值轨迹用于监督微调,从而建立鲁棒的行为先验,同时防止分布坍缩(Distributional Collapse)。其核心思想是“先筛后学”,让模型在高质量数据上打好基础。第二阶段,迭代拒绝 GRPO(Iterative Rejection GRPO, IR-GRPO):在强化学习迭代中,为每个任务维护按难度分层的任务特定队列(Task-specific Queue),动态平衡各任务的数据比例,避免简单任务主导训练;同时引入混合奖励机制(Hybrid Reward Mechanism),融合任务级与步骤级信号,实现跨任务的精确反馈。第三阶段,Trie-GRPO:这是论文的核心创新,基于动作前缀树(Action Prefix Tree)的强化学习算法,能够进行步骤级优势估计(Step-level Advantage Estimation)。它通过树结构隔离中间正确决策与下游错误,从而解决信用分配问题,并在探索效率与探索深度之间取得优于传统搜索树(如 MCTS)的平衡。与现有方法相比,EmbodiedMind 的本质区别在于:它不是单一技巧的改进,而是从数据筛选、任务平衡到信用分配的全链路系统性设计,最终在 18 个基准上取得 70.02% 的平均性能,并在长程规划任务上显著超越其他具身基础模型。
技术方法详解(How - 怎么实现的)
【技术方法详解】
- RSFT 拒绝采样微调:对原始轨迹池进行质量评估,定义信息量分数(如动作多样性、状态覆盖率、奖励方差等),设定阈值
,仅保留分数高于 的样本用于监督微调。此举既提升样本效率,又通过限制数据分布避免模型过拟合到低质模式,防止分布坍缩。 - IR-GRPO 迭代拒绝 GRPO:在每轮强化学习迭代中,对每个任务按难度分层(如简单、中等、困难),维护独立队列。采样时按比例从各队列抽取,确保任务间梯度贡献均衡。混合奖励机制将稀疏的任务级奖励与密集的步骤级奖励加权融合:
,其中 可自适应调整。 - Trie-GRPO 前缀树强化学习:将轨迹建模为动作前缀树,每个节点代表一个动作前缀,边代表动作。通过树结构,可以计算每个步骤的局部优势(Local Advantage),而非整条轨迹的全局优势。具体地,对节点
的优势估计为 ,其中 为子节点权重。这样,即使最终轨迹失败,中间正确分支仍能获得正优势。 - 步骤级优势估计与信用分配:Trie-GRPO 通过树的反向传播,将最终奖励分解到各步骤。对于正确中间决策,其子树中若存在成功路径,则该决策获得正优势;对于错误决策,其子树无成功路径,则获得负优势。这实现了细粒度信用分配。
- 探索效率与深度平衡:传统 MCTS 需要大量模拟,而 Trie-GRPO 利用前缀树共享前缀,减少重复计算,同时通过 GRPO 的策略梯度更新,在探索新分支与利用已知好分支之间动态平衡。
- 训练流程协同:RSFT 提供初始策略,IR-GRPO 在平衡数据上迭代优化,Trie-GRPO 在长程任务上精调,三阶段串行但共享模型参数,形成端到端高效训练管线。
系统架构图
方法流程图
核心公式与算法
【核心公式】
- 混合奖励机制:$$R_{hybrid} = \alpha R_{task} + (1-\alpha) R_{step}$$ 其中
为任务级稀疏奖励, 为步骤级密集奖励, 为平衡权重。 - Trie-GRPO 步骤级优势估计:$$A(s) = \sum_{c \in children(s)} w_c \cdot A(c)$$ 其中
为前缀树节点, 为子节点, 为子节点权重, 为子节点优势。 - GRPO 策略梯度目标:$$\mathcal{L}{GRPO} = \mathbb{E}\left[ \min\left( \frac{\pi\theta(a|s)}{\pi_{old}(a|s)} A(s), \text{clip}\left( \frac{\pi_\theta(a|s)}{\pi_{old}(a|s)}, 1-\epsilon, 1+\epsilon \right) A(s) \right) \right]$$ 其中
为当前策略, 为旧策略, 为裁剪系数。
应用场景(Where - 在哪落地)
【应用场景】
- 家庭服务机器人:在家庭环境中,机器人需完成多步任务如“把杯子拿到厨房并放入洗碗机”。传统轨迹级奖励会导致即使机器人正确抓取杯子,但因后续放置错误而惩罚抓取动作。EmbodiedMind 的 Trie-GRPO 能隔离正确抓取决策,给予正优势,从而加速学习。RSFT 过滤无效探索轨迹,IR-GRPO 平衡不同家务任务的训练,预期使机器人在长程家务任务中成功率提升 10% 以上。
- 自动驾驶长程规划:自动驾驶需在复杂交通中完成多步决策,如变道、超车、路口通行。信用分配问题尤为突出:一次错误刹车可能导致整条轨迹被惩罚,但之前的正确变道决策不应被否定。Trie-GRPO 可对每个决策步骤进行细粒度评估,IR-GRPO 平衡不同驾驶场景(高速、城区、泊车)的训练,预期提升复杂场景下的规划安全性与平滑性。
- 工业机器人装配:在精密装配中,机器人需执行数十步操作。RSFT 筛选高质量装配轨迹,IR-GRPO 平衡不同装配任务,Trie-GRPO 对每步装配动作进行信用分配,预期减少训练样本需求 35%,同时提高装配成功率与鲁棒性。
具体技术细节示例(How in Action - 算法如何执行)
【具体技术细节示例】假设一个简单的长程导航任务:智能体需从起点
RSFT 阶段:计算每条轨迹的信息量分数,例如轨迹
IR-GRPO 阶段:将导航任务按难度分为简单(单房间)、中等(双房间)、困难(三房间)。假设简单队列有 20 条,中等 15 条,困难 10 条。按比例采样,确保困难任务不被忽略。对一条困难轨迹,任务级奖励
Trie-GRPO 阶段:构建动作前缀树。根节点为空,第一层为第一步动作。假设有两条轨迹:
实验结果(Results - 效果如何)
【实验结果】论文在 18 个具身智能基准上进行了广泛评估,涵盖导航、物体操作、长程规划等任务。对比方法包括当前主流的具身基础模型(如基于大规模监督微调的模型、传统 GRPO 训练模型、以及采用课程学习的变体)。实验设置上,RSFT 阶段使用拒绝采样阈值
实验结果可视化
优势与不足
【优势与不足】
- 优势:
- 系统性解决三大瓶颈:从数据筛选、任务平衡到信用分配,形成完整闭环,而非单点改进。
- Trie-GRPO 创新性强:基于动作前缀树的步骤级优势估计,有效解决长程规划中的信用分配问题,且比 MCTS 更高效。
- 实验充分且性能领先:在 18 个基准上取得 70.02% 的 SOTA 平均性能,长程任务提升显著,且样本效率提高 35%。
- 不足:
- 三阶段串行训练可能增加整体训练时间与调参复杂度,各阶段超参数(如阈值
、混合奖励权重 )需精细调节。 - 前缀树的构建与维护在大规模动作空间下可能带来内存与计算开销,论文未充分讨论其可扩展性边界。
- 实验主要在仿真环境进行,真实物理世界的迁移效果尚待验证。
- 三阶段串行训练可能增加整体训练时间与调参复杂度,各阶段超参数(如阈值
相关工作
【相关工作】
- 具身基础模型:如 RT-2、PaLM-E 等,通过大规模视觉-语言-动作数据训练通用策略,但样本效率低,本文通过 RSFT 与 IR-GRPO 改进。
- GRPO 及其变体:DeepSeek 提出的 Group Relative Policy Optimization,用于语言模型对齐,本文将其扩展到具身任务并引入迭代拒绝与混合奖励。
- 信用分配与步骤级强化学习:如 Hindsight Experience Replay、Step-level Advantage,本文的 Trie-GRPO 通过前缀树实现更精细的步骤级优势估计。
- 拒绝采样与数据筛选:在 LLM 训练中常用,本文将其系统化用于具身轨迹筛选,防止分布坍缩。
- 课程学习与任务平衡:如 Prioritized Experience Replay,本文通过难度分层队列实现跨任务梯度平衡。
未来研究方向
【未来方向】
- 真实世界迁移与在线学习:将 EmbodiedMind 从仿真环境扩展到真实机器人,研究在线拒绝采样与增量前缀树更新,以适应动态环境。
- 多模态与多智能体扩展:将 Trie-GRPO 扩展到多智能体协作场景,构建联合动作前缀树,解决多智能体信用分配问题。
- 自动化超参数优化:研究自适应调整
、 以及队列比例的方法,减少人工调参,提升训练鲁棒性。
一句话总结
【一句话总结】EmbodiedMind 通过拒绝采样微调、迭代拒绝 GRPO 与前缀树强化学习三阶段协同,高效解决具身智能训练中的样本低效、任务失衡与信用分配难题。
本解读由 DeepSeek AI 自动生成,仅供参考。