Unverified50% confidenceFactExact time
AlphaGo Lee先用人类棋谱做监督预训练再用强化学习自我对弈提升,而AlphaGo Zero完全抛弃人类数据纯粹从自我对弈学习并达到更高水平
1
Sources
50%
Confidence
Long-term
Relevance
8/28/2026
First Seen
Sources
Related Entities
Related Claims
Unverified代码任务的强化学习自我博弈(Self-Play)机制借鉴了AlphaGo的训练范式76% similarUnverifiedAlphaGo击败人类围棋冠军是强化学习的标志性应用76% similarUnverified2016年击败李世石的AlphaGo Lee使用了约16万局人类职业棋手对弈数据进行监督学习预训练68% similarUnverifiedAlphaStar采用多智能体自我博弈和联盟训练机制,其训练量相当于人类玩家200年的游戏经验66% similarUnverifiedAlphaStar在2019年在《星际争霸II》欧服达到大师级水平(前0.15%),通过模仿学习与多智能体强化学习的结合实现63% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/813482API
curl https://kongchang.com/api/v1/knowledge/claims/813482MCP
get_claim(id=813482)