概念credit assignment
信用分配
强化学习中的核心问题,指如何将最终奖励信号归因到历史动作序列中各个具体步骤的方法与机制
时间轴 (近 90 天)
9月29日
在稀疏奖励场景下,智能体可能完成数千步操作后才收到唯一一个信号,使得信用分配极为困难
待验证50%
9月24日
GRPO及相关策略梯度方法把一次完整的多轮交互轨迹压缩成一个标量奖励再送入策略更新,在处理复合技能任务时会造成有损的信用分配
待验证50%
9月18日
信用分配问题指在多步骤智能体任务中,传统奖励只在任务最终完成时给出总分,无法告知模型哪一步做对或做错,是agentic RL研究中最核心的工程挑战之一
待验证50%