AI玩转《宝可梦红》:Jev仅花2美元通关两个道馆

AI模型Jev边玩《宝可梦红》边自建工具链,不到2美元已通过两个道馆。
一位Reddit用户让AI模型Jev实时游玩经典游戏《宝可梦红》,并由Opus 5在游戏推进过程中同步构建控制框架(harness)。这种"边跑边搭"的模式不仅展示了AI的工程推理与自主执行能力,更令人关注的是其极低的运行成本——击败两个道馆的全程token消耗不到2美元。这一数字折射出两个趋势:新一代模型推理效率的显著提升,以及精细任务编排对无效调用的有效压缩。《宝可梦红》因涵盖长期记忆、地图导航、战斗策略等多维挑战,已成为评估AI长时序规划能力的理想基准。这次社区自发实验表明,AI智能体从"回答问题"到"自主完成复杂任务"的转变正在以极低的门槛快速落地。
一次低成本的AI游戏实验
一位Reddit用户分享了一个颇具趣味的AI实验:让名为Jev的AI模型实时游玩经典游戏《宝可梦红》(Pokemon Red),而游戏运行所需的"harness"(控制框架/中间层)则由Opus 5在过程中同步搭建。这种边玩边构建工具链的做法,展示了当前AI在自主任务执行上的灵活性。
据发帖者描述,Jev已经击败了游戏中的两个道馆(gym),而截至分享时,运行Jev所消耗的token总成本还不到2美元。这个数字本身就是这次实验最引人注目的亮点——它说明AI玩复杂游戏的门槛正在快速下降。

为什么"harness"是关键
让AI游玩一款像《宝可梦红》这样的回合制RPG,并不是简单地把游戏画面丢给模型就能完成。AI需要一套中间层来读取游戏状态、解析画面信息、并把决策转化为具体的操作指令。这套框架通常被称为"harness"。
值得关注的是,在这次实验中,harness并非事先写好,而是由Opus 5实时构建。这意味着模型在游戏推进的同时,还在不断完善与游戏交互的工具接口。这种"边跑边搭"的模式,考验的是AI的工程能力与任务分解能力,也让整个过程更接近真实的自主智能体(agent)工作流。
从技术实现角度来看,harness通常需要完成以下几个核心职责:通过模拟器API(如PyBoy或BizHawk)读取游戏内存中的状态数据(角色位置、HP、背包物品等);将游戏画面截图或结构化状态转化为模型可理解的文本/图像输入;接收模型输出的行动指令并映射为实际按键操作;以及维护一个"记忆缓冲区"来避免模型在长对话中遗忘关键进度。Opus 5在游戏过程中实时生成这套框架,本质上是在执行一种"工具使用(tool use)+ 自我反思"的循环:模型先尝试某种接口设计,根据游戏反馈判断是否有效,再迭代修改。这种能力与近年来兴起的"LLM作为程序员"范式高度契合,也是评估模型工程推理能力的重要维度。
成本才是真正的信号
在过去,让大型模型完成长时序、多步骤的游戏任务往往意味着高昂的推理成本。而这次不到2美元就打完两个道馆的记录,反映出两个趋势:
- 模型效率提升:新一代模型在完成同样任务时消耗的token更少。
- 任务编排更精细:合理的harness设计能减少无效的推理调用,避免token浪费。
对于开发者和爱好者而言,低成本意味着这类实验不再是资源雄厚的实验室的专利。任何人都可以用几美元的预算,跑一场自己的AI游戏挑战。
用游戏检验AI能力的价值
《宝可梦红》作为AI基准测试的载体并不是偶然。这类游戏包含长期记忆、地图导航、战斗策略、资源管理等多重挑战,能够综合检验一个模型的规划与执行能力。相比一次性问答,通关游戏要求AI在数百甚至上千步操作中保持目标一致性。
Anthropic此前也曾用《宝可梦》系列作为衡量Claude长时序能力的参考。这次社区用户的自发实验,某种程度上延续了这一思路——用一个人人熟悉的游戏,直观地展现AI能力的边界。
《宝可梦红》发布于1996年,是Game Boy平台的回合制RPG经典,整个游戏包含8个道馆、151种可捕捉精灵以及线性叙事主线。从AI基准测试的角度看,它的优势在于:状态空间有限但决策树极深(通关需要数百步有效操作);游戏规则对人类玩家高度透明,便于评估AI是否"真正理解"而非随机试探;且社区工具链成熟,便于低成本接入。2024年,一个名为"Twitch Plays Pokémon AI"的项目和Anthropic内部的Claude评测都曾以此为测试场景。相比抽象的数学推理题或代码生成任务,游戏通关进度是一个直观且可量化的里程碑,使得不同模型、不同时间节点的能力对比更为清晰。
结语:小实验,大想象
这条Reddit帖子本身信息量不大,但它折射出的方向值得留意:AI智能体正在从"回答问题"走向"完成任务",而完成任务的成本正在急剧下降。当一个AI能用不到2美元玩转经典游戏并自建工具链时,我们有理由对更复杂、更实用的自主智能体应用抱有期待。
感兴趣的读者可以关注原作者的后续更新,围观这场AI宝可梦挑战能走多远。
相关推荐

20-30人小团队如何选对多智能体AI平台?
20-30人的初创团队如何在数十款多智能体AI平台中选对工具?本文基于Reddit真实讨论,分析中小团队的选型痛点,并给出从高频场景切入、关注留存意愿等实用建议。

Roku Labs 上线:实验性应用登陆大屏幕
Roku 最新 OS 更新推出 Roku Labs 实验性应用入口,同时扩展个性化主屏市场覆盖并引入流媒体订阅捆绑功能,进一步强化其智能电视软件生态。

苹果调整欧盟ATT追踪授权提示:给开发者更多灵活性
苹果因竞争监管压力,将在欧洲部分地区调整App Tracking Transparency(ATT)追踪授权提示,允许开发者使用更温和的同意界面。本文解析ATT争议根源、具体变化及其对隐私与广告生态的双重影响。