[KongchangAI]
ConceptSubtask-Decomposed Advantage Estimation / 子任务分解优势估计

SDAE

RLDS方法的核心组件,将整条轨迹奖励按子任务分类体系拆分,分别计算子任务级组相对优势,并通过反思标记实现token级信用分配,是标量GRPO优势函数的替代方案

Timeline (last 90 days)

Sep 24

RLDS的核心组件是子任务分解优势估计(SDAE),被设计为标量GRPO优势函数的替代品

Unverified50%
Sep 24

SDAE的工作流程分三步:根据固定子任务分类体系拆分奖励、分子任务计算组相对优势、按重要性加权分配token级信用

Unverified50%
Sep 24

SDAE通过反思(reflection)标记来定位哪一步对某个子任务执行有关键影响,将梯度集中引导至这些位置

Unverified50%

All Facts (3)

Source Articles