待验证50% 置信事实精确时间
IQL(Implicit Q-Learning)由Kostrikov等人于2021年提出,通过期望回归规避对分布外动作的直接查询
1
来源数
50%
置信度
长期有效
时效性
2026/7/17
首次发现
来源
相关事实
待验证C51(Categorical DQN)由Bellemare、Dabney和Munos于2017年提出,是分布式强化学习的开山之作61% 相似待验证Akyürek et al. 2022从梯度下降视角论证ICL本质上是隐式的元学习60% 相似待验证CFR由Zinkevich等人于2007年在NIPS提出,理论基础是在线学习中的遗憾界理论,平均策略在迭代次数趋于无穷时收敛至纳什均衡60% 相似待验证2022年吴恩达在Coursera更新推出了新版机器学习专项课程,融入了偏差-方差权衡、误差分析等模型调优方法论59% 相似已验证Q-learning是强化学习中的值函数方法,由Watkins于1989年提出,核心是维护Q表并通过贝尔曼方程迭代更新57% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/547321API
curl https://kongchang.com/api/v1/knowledge/claims/547321MCP
get_claim(id=547321)