NEAT
一种通过进化算法同时优化神经网络结构和权重的神经进化方法,由Kenneth Stanley和Risto Miikkulainen于2002年提出,引入物种机制和历史标记,能自动进化网络拓扑结构
时间轴 (近 90 天)
NEAT不像传统强化学习那样依赖梯度下降,而是模拟自然选择进行迭代
NEAT由Kenneth Stanley和Risto Miikkulainen于2002年提出
NEAT的核心创新在于引入了物种(speciation)机制来保护创新性结构的早期生存
NEAT使用历史标记(historical markings)追踪基因的同源性,使得不同拓扑的网络之间可以进行有意义的交叉
一位Reddit开发者用NEAT进化出的马里奥控制器成功通关了《Bowser's Crown 4-1》关卡
项目中神经网络从模拟器内存读取附近游戏状态信息(敌人、地形、马里奥位置)并输出按键操作
ROM Hack关卡的回溯(backtracking)和非线性复杂布局对基于向右移动奖励信号进化的网络极不友好
解决回溯问题通常需要更精细的奖励塑形或引入时序记忆机制,标准NEAT的前馈或简单循环网络在处理长时序依赖时存在局限
该项目每个新关卡都是单独训练的,通关不能证明网络对陌生关卡具备泛化能力
NEAT天然适合处理离散动作空间和稀疏奖励的游戏环境,且能自动进化网络拓扑结构
全部知识事实 (9)
NEAT由Kenneth Stanley和Risto Miikkulainen于2002年提出
60%待验证NEAT的核心创新在于引入了物种(speciation)机制来保护创新性结构的早期生存
50%待验证NEAT使用历史标记(historical markings)追踪基因的同源性,使得不同拓扑的网络之间可以进行有意义的交叉
50%待验证项目中神经网络从模拟器内存读取附近游戏状态信息(敌人、地形、马里奥位置)并输出按键操作
50%待验证ROM Hack关卡的回溯(backtracking)和非线性复杂布局对基于向右移动奖励信号进化的网络极不友好
50%待验证解决回溯问题通常需要更精细的奖励塑形或引入时序记忆机制,标准NEAT的前馈或简单循环网络在处理长时序依赖时存在局限
50%待验证该项目每个新关卡都是单独训练的,通关不能证明网络对陌生关卡具备泛化能力
50%待验证NEAT不像传统强化学习那样依赖梯度下降,而是模拟自然选择进行迭代
50%待验证NEAT天然适合处理离散动作空间和稀疏奖励的游戏环境,且能自动进化网络拓扑结构
50%