概念League Play / 联盟训练
联盟对战
多智能体强化学习中的训练方法,通过让智能体与包含多种策略和不同强度对手的联盟进行对战,防止陷入局部最优,促进通用鲁棒策略的学习,由DeepMind在AlphaStar中大规模应用
时间轴 (近 90 天)
9月27日
联盟对战让智能体与一个包含多种策略、不同强度对手的联盟进行对战,以防止陷入单一策略的局部最优和过拟合
待验证50%
9月27日
联盟对战概念曾在 DeepMind 的《星际争霸II》AI AlphaStar 中被大规模应用
待验证50%
9月27日
联盟对战通过种群多样性来规避循环克制(rock-paper-scissors)问题
待验证50%
9月27日
作者借助奖励塑形和联盟对战最终训练出相对有趣的对战表现
待验证50%