模型AlphaGo Zero
AlphaGo Zero
DeepMind开发的围棋AI,通过纯自我博弈强化学习训练,无需人类棋谱即可达到超人水平
时间轴 (近 90 天)
9月4日
AlphaGo Zero在每轮迭代中,新版本与旧版本对弈,胜率超过55%则替换旧版本
待验证50%
9月4日
AlphaGo Zero的成功依赖于围棋是规则完备、结果可验证的封闭系统,这是将自我对弈扩展到通用AI的主要障碍之一
待验证50%
9月3日
AlphaGo Zero由DeepMind于2017年发布,使用蒙特卡洛树搜索结合深度神经网络,完全不依赖人类棋谱从零开始训练
待验证50%
9月3日
AlphaGo Zero每一轮迭代中新版本与旧版本对弈,胜率超过55%则替换旧版本,经过约4900万局自我对弈仅40天训练即超越人类顶尖棋手
待验证50%
8月31日
AlphaGo Zero完全不使用人类棋谱,从零开始自我对弈就超越了所有前代版本
待验证50%
8月28日
AlphaGo Lee先用人类棋谱做监督预训练再用强化学习自我对弈提升,而AlphaGo Zero完全抛弃人类数据纯粹从自我对弈学习并达到更高水平
待验证50%
全部知识事实 (6)
待验证
AlphaGo Zero在每轮迭代中,新版本与旧版本对弈,胜率超过55%则替换旧版本
50%待验证AlphaGo Zero的成功依赖于围棋是规则完备、结果可验证的封闭系统,这是将自我对弈扩展到通用AI的主要障碍之一
50%待验证AlphaGo Zero由DeepMind于2017年发布,使用蒙特卡洛树搜索结合深度神经网络,完全不依赖人类棋谱从零开始训练
50%待验证AlphaGo Zero每一轮迭代中新版本与旧版本对弈,胜率超过55%则替换旧版本,经过约4900万局自我对弈仅40天训练即超越人类顶尖棋手
50%待验证AlphaGo Zero完全不使用人类棋谱,从零开始自我对弈就超越了所有前代版本
50%待验证AlphaGo Lee先用人类棋谱做监督预训练再用强化学习自我对弈提升,而AlphaGo Zero完全抛弃人类数据纯粹从自我对弈学习并达到更高水平
50%