待验证50% 置信事实精确时间
AlphaGo将深度神经网络与蒙特卡洛树搜索(MCTS)相结合,策略网络预测走法,价值网络评估胜率,训练先用人类棋谱监督学习再通过自我对弈强化学习
1
来源数
50%
置信度
长期有效
时效性
2026/8/31
首次发现
来源
涉及实体
相关事实
已验证AlphaGo击败人类围棋冠军是强化学习的标志性应用76% 相似待验证代码任务的强化学习自我博弈(Self-Play)机制借鉴了AlphaGo的训练范式68% 相似待验证AlphaGo Lee先用人类棋谱做监督预训练再用强化学习自我对弈提升,而AlphaGo Zero完全抛弃人类数据纯粹从自我对弈学习并达到更高水平66% 相似待验证强化学习中策略网络通过最大化累积奖励来优化参数,具有信息瓶颈特性,倾向于只编码对任务目标有用的信息65% 相似待验证小样本学习(Few-Shot Learning)的主流方法包括基于度量学习的Siamese Network、基于元学习的MAML,以及结合预训练大模型的提示微调62% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/830852API
curl https://kongchang.com/api/v1/knowledge/claims/830852MCP
get_claim(id=830852)