[
KongchangAI
]
Feed
Entities
Podcasts
Deep Dives
Developers
About
Get CLI
中文
Concept
Reward Shaping
奖励塑形
强化学习中设计和调整奖励函数的方法,用于引导智能体学习期望行为,是RL调试中的核心难题之一
Source Articles
强化学习奖励塑形与调试实战:从振荡到收敛的系统指南
Jul 11