[控场AI]
概念Subtask-Decomposed Advantage Estimation / 子任务分解优势估计

SDAE

RLDS方法的核心组件,将整条轨迹奖励按子任务分类体系拆分,分别计算子任务级组相对优势,并通过反思标记实现token级信用分配,是标量GRPO优势函数的替代方案

时间轴 (近 90 天)

9月24日

RLDS的核心组件是子任务分解优势估计(SDAE),被设计为标量GRPO优势函数的替代品

待验证50%
9月24日

SDAE的工作流程分三步:根据固定子任务分类体系拆分奖励、分子任务计算组相对优势、按重要性加权分配token级信用

待验证50%
9月24日

SDAE通过反思(reflection)标记来定位哪一步对某个子任务执行有关键影响,将梯度集中引导至这些位置

待验证50%

全部知识事实 (3)

来源文章