Jev玩转宝可梦红:AI智能体挑战复杂游戏的开源实验

开发者开源AI智能体Jev挑战《宝可梦红》,全程直播并公开token消耗与成本。
开发者Christian Mat将AI智能体Jev用于挑战经典游戏《宝可梦红》,并将全部代码开源、全程直播,同时罕见地实时公开AI的token消耗与运行成本。项目选择宝可梦作为测试场,是因为其难度介于俄罗斯方块与《毁灭战士》之间——节奏较慢但需要长期规划与状态记忆,恰好触及当前AI智能体的能力边界。透明的成本数据让观察者得以直观理解"AI玩游戏"的经济代价,开源代码则让社区可以复现、替换模型、优化决策逻辑。该项目在Hacker News获得214赞88条评论,印证了"AI玩游戏"作为智能体能力测试场的持续热度,也提供了一个观察智能体失败模式的低成本透明样本。
一个能快速做决策的AI智能体去玩《宝可梦红》(Pokémon Red)会发生什么?开发者Christian Mat在Hacker News上分享了他的趣味项目——让名为Jev的AI系统尝试通关这款经典掌机游戏,并把全部代码开源,同时直播了整个游戏过程,连消耗的token和成本都实时展示。
这个项目上线后迅速在HN获得214个赞和88条评论,成为社区里颇受关注的Show HN帖子。它的价值不在于炫技,而是提供了一个观察AI决策能力边界的透明窗口。

从俄罗斯方块到宝可梦:难度的跃升
开发者提到,Jev的决策速度很快——快到能玩俄罗斯方块(Tetris),但还不足以驾驭像《毁灭战士》(Doom)这样需要极高实时反应的游戏。于是他选择了《宝可梦红》作为介于两者之间的挑战对象。
这个选择很有意思。俄罗斯方块的状态空间相对简单,规则明确,反馈即时;而《毁灭战士》是第一人称射击,要求毫秒级的连续操作。宝可梦则处于中间地带:它节奏偏慢,但游戏世界庞大、任务链条复杂,涉及探索地图、管理精灵队伍、回合制战斗、道具使用等多种决策类型。
对AI智能体而言,宝可梦的难点不在反应速度,而在长期规划与状态记忆。玩家需要记住去过哪里、要做什么、当前目标是什么——这恰恰是当前AI智能体最容易"卡壳"的地方。开发者半开玩笑地说,希望别"卡在山洞里",这其实点出了此类项目的经典难题:智能体在开放环境中容易迷失方向、陷入循环。
从AI研究的角度来看,"长期规划与状态记忆"的难题有其技术根源。当前主流的大语言模型(LLM)驱动的智能体通常通过上下文窗口(context window)来维持"记忆"——每次推理时,模型只能看到有限长度的历史信息。在宝可梦这类游戏中,玩家可能需要记住几十步前做过的选择(比如是否已经拿到某把关键道具、某条路是否已经走过),而这些信息一旦超出上下文窗口范围,智能体便会"失忆",进而出现目标漂移或原地打转的行为。部分项目通过外部记忆模块(如向量数据库存储历史状态摘要)来缓解这一问题,但如何有效压缩和检索游戏状态至今仍是开放性挑战。
透明化实验:token与成本实时可见
项目的一大亮点是全程直播,而且把AI消耗的token数量和运行成本一并公开。这种做法在AI应用演示中并不常见,却极具参考价值。
让AI玩游戏本质上是一个持续调用模型的过程——每一步决策都可能对应一次推理请求。随着游戏时长累积,token消耗会不断攀升,成本也随之增加。把这些数据摆到台面上,让观众能直观理解"AI玩一款游戏到底要花多少钱",也间接反映了当前智能体在长时间任务中的经济性问题。
对于研究者和开发者来说,这类透明数据比单纯的"看AI通关"更有意义。它揭示了AI智能体在实际应用中的一个核心权衡:能力与成本之间的平衡。
Token是大语言模型处理文本的基本计量单位,粗略来说,英文约每4个字符对应1个token,中文约每1-2个汉字对应1个token。模型的调用费用通常按输入与输出token数量分别计费。在智能体玩游戏的场景中,每一步决策往往需要将当前游戏画面(或结构化的游戏状态描述)、历史行动记录以及任务目标一并输入模型,再由模型输出下一步操作指令。如果每秒或每几秒就触发一次推理,累积的token量会相当可观。以GPT-4级别的模型为例,连续数小时的游戏可能产生数美元至数十美元的API费用,这使得智能体的"经济效率"成为工程落地时不可忽视的约束条件。
开源:可复现、可魔改的社区资产
开发者把所有代码开源在GitHub仓库(christianmat/jev-pokemon),鼓励其他人自行折腾。这一举动让项目从个人娱乐升级为社区可参与的实验平台。
近年来,"让AI玩游戏"已成为检验智能体能力的流行范式。从早期的Atari游戏强化学习,到近期各类大模型玩宝可梦、玩《我的世界》的尝试,游戏一直是衡量AI规划、探索与决策能力的天然测试场。宝可梦尤其受欢迎,因为它既有明确的通关目标(收集徽章、击败道馆),又需要在庞大世界中做出连贯决策。
开源意味着任何人都可以:
- 复现整个实验,验证AI的表现
- 替换底层模型,对比不同AI的游戏能力
- 优化决策逻辑,尝试解决"卡在山洞"这类问题
- 基于框架拓展到其他游戏
这种开放性正是Show HN文化的精髓——分享一个能跑起来的东西,让社区一起改进。
AI玩游戏的研究路径大致可分为两代范式。早期以DeepMind的DQN(深度Q网络)为代表,采用强化学习让模型从零开始通过试错积累游戏经验,Atari系列游戏是这一范式的标准测试床。这类方法需要数百万步的自我博弈训练,资源消耗巨大,且训练结果难以迁移到新游戏。近年兴起的第二代范式则是将预训练好的大语言模型或多模态模型直接用作智能体的"大脑",依靠模型已有的常识与推理能力来理解游戏规则并制定策略,无需专门训练。Jev玩宝可梦属于后者,优势是开发门槛低、可快速迁移,劣势是推理成本高、且受限于模型的上下文记忆能力。
这类项目意味着什么
抛开趣味性,Jev玩宝可梦的实验触及了AI智能体研究的几个真实议题。游戏提供了一个封闭但足够复杂的环境,用来观察AI能否完成需要多步规划、长期记忆和适应性决策的任务。
开发者坦言目前还不确定能否拿到所有徽章,这份诚实反而增加了实验的可信度。AI智能体在这类开放任务中的失败模式——迷路、重复动作、目标漂移——本身就是宝贵的研究素材。透明地展示成功与失败,比只展示高光时刻更有价值。
对普通观众而言,这是一场有趣的直播;对开发者而言,这是一个可上手的开源项目;对研究者而言,这是一个观察智能体决策边界的低成本样本。三种价值叠加,正是它能在HN获得高关注的原因。
相关推荐

Seedance集成Computer:营销与品牌团队的AI新利器
Seedance 集成到 Computer 平台后,为营销和品牌团队带来 AI 视频内容生成的新可能。本文解析这类集成式 AI 工具对营销工作流的价值与落地考量。

vLLM 发布 v0.31.0:为 Transformers 版本设置上限约束
vLLM 发布 v0.31.0 版本,核心改动是在依赖项中为 Transformers 库添加版本上限约束,提升兼容性与部署稳定性。本文解析该改动的技术动机与对使用者的实际影响。

Perplexity 开源大爆发:6款AI模型与工具一次盘点
Perplexity 近期集中开源六款 AI 项目,包括 SoTA 多模态决策模型 pplx-decider、上下文嵌入模型、Apple Silicon 本地推理引擎 Lily、端侧隐私分类器 PII-Tracer 及多款安全工具,覆盖模型、推理与终端安全全链路。