待验证50% 置信事实精确时间
基于势函数的奖励塑形(Ng 等人,1999)经理论证明不会改变最优策略,其形式为 F = γΦ(s') - Φ(s)
1
来源数
50%
置信度
长期有效
时效性
2026/7/11
首次发现
来源
强化学习奖励塑形与调试实战:从振荡到收敛的系统指南
redditr/reinforcementlearning2026/7/9
相关事实
待验证1999年Ng、Harada与Russell在ICML证明,只有基于势函数的奖励塑形(F(s,s')=γΦ(s')-Φ(s))才能保证不改变最优策略79% 相似待验证Hardy、Benedicks、Amrein-Berthier等人证明了函数及其傅里叶变换的支撑集不能同时具有有限测度(除非函数为零)63% 相似待验证奖励塑形技术由Andrew Ng等人在1999年的论文中进行了理论化分析,证明了在保持最优策略不变的前提下如何安全地进行奖励塑形62% 相似待验证拉格朗日对偶通过引入拉格朗日乘子将约束吸收进目标函数,再利用 KKT 条件转化为对偶问题,引出支持向量和核技巧的理论基础61% 相似待验证Hardy在1933年证明:如果函数f(x)和其傅里叶变换都以高斯函数e^{-πx²}速率衰减,则f必须是高斯函数的常数倍;衰减更快则f≡061% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/474923API
curl https://kongchang.com/api/v1/knowledge/claims/474923MCP
get_claim(id=474923)