[KongchangAI]
ConceptReinforcement Learning with Decomposed Subtasks

RLDS

一种强化学习方法,通过将轨迹奖励按子任务维度分解来改善信用分配,核心组件为子任务分解优势估计(SDAE),用于替代标量GRPO优势函数,实现更精准的token级梯度信号

Timeline (last 90 days)

Sep 24

对于技能构成单一、反馈相对密集的任务,细粒度奖励分解的价值有限

Unverified50%
Sep 24

arXiv论文提出RLDS(Reinforcement Learning with Decomposed Subtasks)方法,核心观点是轨迹奖励应在进入策略更新前沿子任务维度拆分

Unverified50%
Sep 24

RLDS的核心组件是子任务分解优势估计(SDAE),被设计为标量GRPO优势函数的替代品

Unverified50%
Sep 24

作者在FrozenLake、HotpotQA、ScienceWorld、DeepResearch四个智能体基准上评估了RLDS

Unverified50%
Sep 24

RLDS在ScienceWorld上提升+11.5分(95%置信区间[+9.8, +13.3]),在FrozenLake上提升+9.8分([+7.0, +12.8])

Unverified50%
Sep 24

RLDS在HotpotQA和DeepResearch上的提升处于噪声范围内,与这两个任务可回收信息不多的诊断预测一致

Unverified50%
Sep 24

RLDS带来的收益随子任务异质性增长而放大,在高异质性任务上提升最显著

Unverified50%
Sep 24

RLDS在ScienceWorld上每步墙钟时间比标量GRPO减少10.9%,原因是长轨迹摊薄了反思与评分的固定开销

Unverified50%
Aug 29

RLDS(Reinforcement Learning Datasets)是Google DeepMind提出的基于TFRecord的标准化格式,用于存储强化学习和机器人学习的交互数据

Unverified50%

All Facts (9)

Source Articles