Unverified50% confidenceFactExact time
1999年Ng、Harada与Russell在ICML证明,只有基于势函数的奖励塑形(F(s,s')=γΦ(s')-Φ(s))才能保证不改变最优策略
1
Sources
50%
Confidence
Long-term
Relevance
7/19/2026
First Seen
Sources
Related Claims
Unverified基于势函数的奖励塑形(Ng 等人,1999)经理论证明不会改变最优策略,其形式为 F = γΦ(s') - Φ(s)79% similarUnverified奖励塑形技术由Andrew Ng等人在1999年的论文中进行了理论化分析,证明了在保持最优策略不变的前提下如何安全地进行奖励塑形62% similarUnverified在纽结理论中,AI发现了双曲体积与代数不变量之间此前未知的函数关系61% similarUnverifiedHardy、Benedicks、Amrein-Berthier等人证明了函数及其傅里叶变换的支撑集不能同时具有有限测度(除非函数为零)60% similarUnverifiedCAP 定理由 Eric Brewer 于2000年提出,后由 Gilbert 和 Lynch 于2002年正式证明,指出分布式系统无法同时保证一致性、可用性和分区容错性58% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/563206API
curl https://kongchang.com/api/v1/knowledge/claims/563206MCP
get_claim(id=563206)