[控场AI]
概念League Play / 联盟训练

联盟对战

多智能体强化学习中的训练方法,通过让智能体与包含多种策略和不同强度对手的联盟进行对战,防止陷入局部最优,促进通用鲁棒策略的学习,由DeepMind在AlphaStar中大规模应用

时间轴 (近 90 天)

9月27日

联盟对战让智能体与一个包含多种策略、不同强度对手的联盟进行对战,以防止陷入单一策略的局部最优和过拟合

待验证50%
9月27日

联盟对战概念曾在 DeepMind 的《星际争霸II》AI AlphaStar 中被大规模应用

待验证50%
9月27日

联盟对战通过种群多样性来规避循环克制(rock-paper-scissors)问题

待验证50%
9月27日

作者借助奖励塑形和联盟对战最终训练出相对有趣的对战表现

待验证50%

全部知识事实 (4)

来源文章