Unverified50% confidenceFactExact time
AlphaGo将深度神经网络与蒙特卡洛树搜索(MCTS)相结合,策略网络预测走法,价值网络评估胜率,训练先用人类棋谱监督学习再通过自我对弈强化学习
1
Sources
50%
Confidence
Long-term
Relevance
8/31/2026
First Seen
Sources
Related Entities
Related Claims
VerifiedAlphaGo击败人类围棋冠军是强化学习的标志性应用76% similarUnverified代码任务的强化学习自我博弈(Self-Play)机制借鉴了AlphaGo的训练范式68% similarUnverifiedAlphaGo Lee先用人类棋谱做监督预训练再用强化学习自我对弈提升,而AlphaGo Zero完全抛弃人类数据纯粹从自我对弈学习并达到更高水平66% similarUnverified强化学习中策略网络通过最大化累积奖励来优化参数,具有信息瓶颈特性,倾向于只编码对任务目标有用的信息65% similarUnverified小样本学习(Few-Shot Learning)的主流方法包括基于度量学习的Siamese Network、基于元学习的MAML,以及结合预训练大模型的提示微调62% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/830852API
curl https://kongchang.com/api/v1/knowledge/claims/830852MCP
get_claim(id=830852)