[控场AI]
模型AlphaGo Zero

AlphaGo Zero

DeepMind开发的围棋AI,通过纯自我博弈强化学习训练,无需人类棋谱即可达到超人水平

时间轴 (近 90 天)

9月4日

AlphaGo Zero在每轮迭代中,新版本与旧版本对弈,胜率超过55%则替换旧版本

待验证50%
9月4日

AlphaGo Zero的成功依赖于围棋是规则完备、结果可验证的封闭系统,这是将自我对弈扩展到通用AI的主要障碍之一

待验证50%
9月3日

AlphaGo Zero由DeepMind于2017年发布,使用蒙特卡洛树搜索结合深度神经网络,完全不依赖人类棋谱从零开始训练

待验证50%
9月3日

AlphaGo Zero每一轮迭代中新版本与旧版本对弈,胜率超过55%则替换旧版本,经过约4900万局自我对弈仅40天训练即超越人类顶尖棋手

待验证50%
8月31日

AlphaGo Zero完全不使用人类棋谱,从零开始自我对弈就超越了所有前代版本

待验证50%
8月28日

AlphaGo Lee先用人类棋谱做监督预训练再用强化学习自我对弈提升,而AlphaGo Zero完全抛弃人类数据纯粹从自我对弈学习并达到更高水平

待验证50%

全部知识事实 (6)

来源文章