Unverified50% confidenceFactExact time
2016年击败李世石的AlphaGo Lee使用了约16万局人类职业棋手对弈数据进行监督学习预训练
1
Sources
50%
Confidence
Long-term
Relevance
8/7/2026
First Seen
Sources
Related Claims
Unverified2019年的AlphaStar面临不完全信息、实时决策和高达10^26的动作空间,其联盟训练机制使训练量相当于人类玩家200年的游戏经验59% similarUnverifiedAlphaStar采用多智能体自我博弈和联盟训练机制,其训练量相当于人类玩家200年的游戏经验58% similarUnverifiedAlphaGo击败人类围棋冠军是强化学习的标志性应用58% similarUnverifiedAlphaStar在2019年在《星际争霸II》欧服达到大师级水平(前0.15%),通过模仿学习与多智能体强化学习的结合实现56% similarUnverified经过Claude自动优化,大多数参与横评的模型都能在16GB显存内完成LoRA训练55% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/700727API
curl https://kongchang.com/api/v1/knowledge/claims/700727MCP
get_claim(id=700727)