ConceptSubtask-Decomposed Advantage Estimation / 子任务分解优势估计
SDAE
RLDS方法的核心组件,将整条轨迹奖励按子任务分类体系拆分,分别计算子任务级组相对优势,并通过反思标记实现token级信用分配,是标量GRPO优势函数的替代方案
Timeline (last 90 days)
Sep 24
RLDS的核心组件是子任务分解优势估计(SDAE),被设计为标量GRPO优势函数的替代品
Unverified50%
Sep 24
SDAE的工作流程分三步:根据固定子任务分类体系拆分奖励、分子任务计算组相对优势、按重要性加权分配token级信用
Unverified50%
Sep 24
SDAE通过反思(reflection)标记来定位哪一步对某个子任务执行有关键影响,将梯度集中引导至这些位置
Unverified50%