[控场AI]
模型

AlphaZero

AlphaZero是由DeepMind开发的通用棋类博弈AI系统,采用深度强化学习与蒙特卡洛树搜索相结合的方法,无需人类先验知识,仅通过自我对弈即可从零开始学习。该系统在围棋、国际象棋和将棋等多种棋类游戏中达到或超越人类顶级水平,展示了通用游戏AI的强大潜力。

时间轴 (近 90 天)

9月10日

AlphaZero没有使用任何人类棋谱,仅通过4小时的自我对弈就超越了Stockfish

待验证50%
8月30日

AlphaProof将AlphaZero的强化学习方法与Lean形式化语言相结合,通过自我博弈生成证明

待验证50%

全部知识事实 (3)

来源文章