[控场AI]
概念Reinforcement Learning with Decomposed Subtasks

RLDS

一种强化学习方法,通过将轨迹奖励按子任务维度分解来改善信用分配,核心组件为子任务分解优势估计(SDAE),用于替代标量GRPO优势函数,实现更精准的token级梯度信号

时间轴 (近 90 天)

9月24日

对于技能构成单一、反馈相对密集的任务,细粒度奖励分解的价值有限

待验证50%
9月24日

arXiv论文提出RLDS(Reinforcement Learning with Decomposed Subtasks)方法,核心观点是轨迹奖励应在进入策略更新前沿子任务维度拆分

待验证50%
9月24日

RLDS的核心组件是子任务分解优势估计(SDAE),被设计为标量GRPO优势函数的替代品

待验证50%
9月24日

作者在FrozenLake、HotpotQA、ScienceWorld、DeepResearch四个智能体基准上评估了RLDS

待验证50%
9月24日

RLDS在ScienceWorld上提升+11.5分(95%置信区间[+9.8, +13.3]),在FrozenLake上提升+9.8分([+7.0, +12.8])

待验证50%
9月24日

RLDS在HotpotQA和DeepResearch上的提升处于噪声范围内,与这两个任务可回收信息不多的诊断预测一致

待验证50%
9月24日

RLDS带来的收益随子任务异质性增长而放大,在高异质性任务上提升最显著

待验证50%
9月24日

RLDS在ScienceWorld上每步墙钟时间比标量GRPO减少10.9%,原因是长轨迹摊薄了反思与评分的固定开销

待验证50%
8月29日

RLDS(Reinforcement Learning Datasets)是Google DeepMind提出的基于TFRecord的标准化格式,用于存储强化学习和机器人学习的交互数据

待验证50%

全部知识事实 (9)

来源文章