fly-connectome-chess
开源强化学习实验项目,将果蝇真实神经连接组作为神经网络拓扑结构,使用虚拟多巴胺奖励机制训练模型下国际象棋,探索生物连接组在机器学习中的应用
时间轴 (近 90 天)
一位Reddit用户(AdilSiddiqui)将果蝇的真实神经连接组作为神经网络骨架,用强化学习训练它下国际象棋
该项目的核心设计约束是信号只能沿着真实存在的生物突触流动,连接矩阵是稀疏的且由生物结构预先决定
该项目的强化学习机制被称为虚拟多巴胺,只有当模型执行合法国际象棋走子或吃掉对方棋子时才施加突触权重调整
该项目已开源到GitHub仓库fly-connectome-chess,提供可在本地GPU运行的训练流程,可在Web UI中点击Train按钮开始训练
作者发起挑战:如果训练出的ELO分数超过他,可提交一个包含weights.pt的PR
该项目并未采用脉冲机制,仍在标准的反向传播/权重更新框架内运行,因此与硬件层面的神经形态计算有所区别
该项目的虚拟多巴胺仅以合法走子和吃子作为离散正向事件触发权重更新,没有负向惩罚,也没有对奖励预测误差的显式建模
该项目是概念验证式探索,用来检验稀疏生物拓扑加强化学习这条路是否走得通,而非给出性能上的结论
全部知识事实 (8)
该项目并未采用脉冲机制,仍在标准的反向传播/权重更新框架内运行,因此与硬件层面的神经形态计算有所区别
50%待验证该项目的虚拟多巴胺仅以合法走子和吃子作为离散正向事件触发权重更新,没有负向惩罚,也没有对奖励预测误差的显式建模
50%待验证该项目是概念验证式探索,用来检验稀疏生物拓扑加强化学习这条路是否走得通,而非给出性能上的结论
50%待验证该项目的核心设计约束是信号只能沿着真实存在的生物突触流动,连接矩阵是稀疏的且由生物结构预先决定
50%待验证该项目的强化学习机制被称为虚拟多巴胺,只有当模型执行合法国际象棋走子或吃掉对方棋子时才施加突触权重调整
50%待验证作者发起挑战:如果训练出的ELO分数超过他,可提交一个包含weights.pt的PR
50%待验证该项目已开源到GitHub仓库fly-connectome-chess,提供可在本地GPU运行的训练流程,可在Web UI中点击Train按钮开始训练
50%待验证一位Reddit用户(AdilSiddiqui)将果蝇的真实神经连接组作为神经网络骨架,用强化学习训练它下国际象棋
50%