[控场AI]
· 4 分钟阅读· 2,300 字

非PPO的Adapt-1:15分钟自学通关超级马里奥1-1

非PPO的Adapt-1:15分钟自学通关超级马里奥1-1

Adapt-1用非PPO、非LLM的两种机制在15分钟内通关马里奥1-1,并全程开源可复现。

Rei Labs的Adapt-1系统通过两条独立路径完成了《超级马里奥兄弟》1-1关卡的通关任务:一是反应式策略模式,系统自学约36分钟后关闭学习,直接用已形成的策略通关;二是Machina序列引擎,通过403次搜索尝试在约11分钟内找到一条可行的固定按键序列。这两种方式均不依赖PPO或大语言模型,提供了一个观察非主流RL路线的具体案例。开发者将代码、实验数据、运行轨迹和成本指南全部开源,具备良好的可复现性。但作者也明确指出,马里奥1-1是确定性环境,当前结果属于概念演示,系统的泛化能力还需在更多关卡与任务上接受检验。

一个不依赖强化学习主流路线的尝试

深度强化学习领域里,PPO(Proximal Policy Optimization)几乎是训练游戏智能体的默认选择,从OpenAI的Dota项目到各类雅达利游戏基准,它都是绕不开的名字。而Rei Labs推出的Adapt-1走了一条不同的路——它既不是基于大语言模型(non-LLM),也不采用PPO。开发者在Reddit上分享了一个相当直观的验证场景:让Adapt-1从零开始学习并通关《超级马里奥兄弟》的经典关卡1-1。

reddit source: My AI learns to clear Super Mario Bros 1-1

马里奥1-1是游戏AI研究里的一个经典试炼场。它看似简单,实则包含了跳跃时机、敌人规避、管道与坑洞判断等多种需要连续决策的要素,因此常被用来验证一个学习系统能否在有限反馈下形成有效策略。

PPO(近端策略优化)由OpenAI于2017年提出,其核心思想是在每次策略更新时通过"裁剪"目标函数来限制更新幅度,从而在学习效率与训练稳定性之间取得平衡。相比早期的策略梯度方法,PPO实现简单、超参数较少、在并行环境下扩展性好,这使它成为游戏AI训练的事实标准。它的局限性在于样本效率相对较低——通常需要数百万乃至数十亿帧的游戏画面才能达到人类水平,且对超参数和环境的细节较为敏感。Adapt-1放弃这条路线,意味着它需要找到另一套机制来解决探索与利用的权衡问题,这也是理解其两种工作模式设计动机的背景。

两种模式:反应式策略与序列搜索

根据开发者的描述,Adapt-1在这次测试中展现了两种不同的工作方式,二者路径和耗时都不一样,值得分开来看。

反应式策略(Reactive Policy)

第一种方式是从自身游玩中学习一套反应式策略。系统在未经训练的状态下启动,通过大约36分钟的实际游玩积累经验,形成策略后,再把学习功能关闭,直接用已习得的策略通关该关卡。这种"先学后用"的分离设计,意味着最终展示的通关行为完全来自此前学到的策略,而非边玩边调整的结果。

Machina序列引擎

第二种方式借助Adapt-1的序列引擎Machina。同样从零开始,它通过搜索的方式寻找一条能够抵达终点旗杆的按键序列。按照开发者给出的数据,这个过程经历了403次尝试,耗费约11分钟的真实时间(wall-clock minutes)便找到了可用序列。

标题中提到的"15分钟"大致对应的就是这条序列搜索路径的量级——相比动辄需要数小时甚至更久训练的传统RL方案,这个时间成本确实偏低。不过需要明确的是,序列搜索找到的是一条针对特定关卡的固定解法,与能够泛化应对不同情形的反应式策略,在本质上是两类产物。

序列搜索与强化学习的根本区别在于目标的表述方式。强化学习试图学习一个通用的状态→动作映射(策略),使其在各种遇到的状态下都能做出合理决策;序列搜索则直接在动作空间中寻找一条能从初始状态抵达目标状态的完整操作序列,类似于路径规划或蒙特卡洛树搜索(MCTS)的思路。在确定性、布局固定的关卡中,后者往往更高效,因为找到一条可行路径即算成功,无需建模泛化能力。403次尝试在11分钟内完成,暗示Machina对每次尝试的评估极为轻量,可能依赖快速模拟或早期终止机制,而非完整运行每一局游戏。

如何看待这组数字

从技术严谨的角度,这组结果有几点需要客观对待。

马里奥1-1是一个相对确定性的环境,关卡布局固定、随机性有限,这使得序列搜索(找到一串固定操作即可通关)成为可行甚至高效的方案。403次尝试在11分钟内完成,说明每次尝试的执行与评估都相当快,但这更接近于一种高效的搜索优化,而非传统意义上的"学习泛化"。

反应式策略那条路径(36分钟自学后关闭学习再通关)则更贴近"学习"的内涵,因为它产出的是一套可重复使用的决策策略。但单关卡、单次演示的样本量,还不足以评估该策略在其他关卡或更复杂环境下的表现。

换句话说,这是一次有说服力的概念演示(proof of concept),而非对Adapt-1通用能力的完整基准测试。真正的价值要等到它在更多关卡、更多游戏乃至非游戏任务上接受检验后才能下结论。

值得称道的开放态度

这个项目一个明显的加分项是它的透明度。开发者公开了代码、完整的实验数据、运行轨迹(traces)、演示片段,以及一份包含成本信息的分步指南,全部托管在GitHub上(hsrvc/adapt1-mario)。

对于声称"非主流路线"的AI系统,可复现性尤为关键。公开完整的数据和轨迹,意味着其他研究者可以自行验证这403次尝试、11分钟通关这类具体数字是否站得住脚,而不是仅凭演示视频下判断。这种做法在当下不少"效果惊艳但无法复现"的AI宣传中,显得尤为可贵。

小结

Adapt-1在马里奥1-1上的表现,提供了一个观察非PPO、非LLM学习系统的具体切口。它用反应式策略和Machina序列引擎两种方式分别完成了通关任务,耗时都在可接受范围内,并且把所有材料开源以供检验。

这类探索的意义,不在于某一次通关有多快,而在于它提示我们:在PPO与大语言模型之外,仍有其他架构值得认真审视。至于Adapt-1能否从一个漂亮的马里奥演示,走向更广泛的真实任务,还需要社区用更多实验来回答。感兴趣的读者可以直接访问其GitHub仓库,复现并评估这些结果。

分享:

相关推荐