[
控场AI
]
知识动态
实体
播客
深度
开发者
关于
Get CLI
EN
概念
reward sparsity / 稀疏奖励
奖励稀疏性
强化学习中的常见问题,指智能体在完成大量步骤后才收到奖励信号,导致信用分配困难、训练效率低下的现象
时间轴 (近 90 天)
9月29日
在稀疏奖励场景下,智能体可能完成数千步操作后才收到唯一一个信号,使得信用分配极为困难
待验证
50%
全部知识事实 (1)
待验证
在稀疏奖励场景下,智能体可能完成数千步操作后才收到唯一一个信号,使得信用分配极为困难
50%
来源文章
构建LLM智能体RL环境:从状态到奖励的六大核心
9月29日