GPT 6 Astra 自主游玩《纪元117》:6小时零指令建成千人城市

GPT 6 Astra仅凭截图与鼠标,无任何专用工具,自主6小时建成千人跨岛城市,展示通用AI Agent的规划与执行潜力。
一位Reddit用户让GPT 6 Astra在无插件、无攻略、仅靠截图感知与鼠标操作的极简条件下,自主游玩策略经营游戏《纪元117:罗马和平》。经过约6小时的运行,AI建成了一座拥有1000+居民、横跨4座岛屿并建立贸易路线的健康城市。《纪元》系列以多级供应链平衡著称,对长期规划能力要求极高,使其成为考验AI通用推理与决策的高难度场景。实验因token额度耗尽而中断,而非AI能力触及瓶颈,凸显出成本仍是此类长时程自主任务规模化的现实障碍。该案例来自单一Reddit分享,缺乏可独立验证的完整录像与方法论,结论需审慎对待,但它所指向的方向——通用视觉Agent在任意GUI环境中自主完成复杂目标——对GUI自动化、软件测试和数字助理场景有直接启示意义。
一位 Reddit 用户做了一个颇具启发性的实验:让 GPT 6 Astra 在完全没有插件、没有 MCP、没有游戏攻略的前提下,仅凭截图理解画面和鼠标操作,从零开始游玩策略经营游戏《纪元117:罗马和平》(Anno 117: Pax Romana)。经过约 6 小时的自主游玩,AI 建成了一座拥有 1000+ 居民、横跨 4 座岛屿并建立贸易路线、解锁大部分建筑的健康城市。
这个案例之所以值得关注,不在于游戏本身,而在于它展示了通用型 AI 智能体(Agent)在开放环境中的规划、执行与自我迭代能力。

实验设置:极简约束下的纯视觉操作
实验者刻意剥离了所有可能给 AI 提供便利的辅助手段。据其描述,整个过程满足以下条件:
- 仅用截图感知环境:AI 通过 ChatGPT 桌面应用截取游戏画面,理解当前状态,而非读取游戏内部数据。
- 仅用鼠标控制操作:所有交互都通过模拟鼠标点击完成,等同于人类玩家的操作方式。
- 没有插件、MCP 或游戏说明:AI 没有获得任何针对该游戏的先验知识或专用工具接口。
- 指令极其简单:实验者只要求它「保持经济健康」并「在进程中提升自己的游戏技巧」。
这种设置的关键在于,它逼近了一个真实世界智能体所面临的挑战——在信息不完整、没有专用接口的情况下,仅凭视觉观察和通用操作手段完成复杂任务。
ChatGPT 桌面应用(Desktop App)的截图能力是这一实验的技术基础。该应用允许模型在用户授权下周期性捕获屏幕内容,将像素级图像作为视觉输入传入多模态模型,再由模型输出下一步操作指令,程序将其转化为实际的鼠标坐标点击。这种「感知—推理—行动」的循环构成了最基础的 Agent 执行框架(Agentic Loop)。与直接调用游戏 API 或读取内存数据的传统 AI 游戏方案相比,纯视觉方案的信息损耗更大——模型必须从像素中推断 UI 元素的语义、数字的含义以及建筑之间的因果关系——但正因如此,其方法论对现实软件环境的迁移性也更强。
《纪元117》为何是个高难度测试场
《纪元》系列是经典的城市建造与经营模拟游戏,其核心难点在于供应链平衡。玩家需要管理从原材料采集、加工生产到居民消费的多级供应链,任何一环脱节都会导致经济崩溃或人口流失。
实验者特别强调「this is a complex game to balance correctly with all supply chains」(要正确平衡所有供应链,这是个相当复杂的游戏)。跨 4 座岛屿建立贸易路线更意味着 AI 需要理解资源在不同地理节点间的调配逻辑,而非简单地在单一地图上堆砌建筑。
能在这样一个多变量、需要长期规划的环境中维持经济健康并持续扩张,说明 AI 不只是在做局部的模式匹配,而是在进行某种程度的全局资源规划。
《纪元》(Anno)系列经营游戏的供应链设计遵循严格的生产比例约束:每种高级商品的生产通常依赖多种初级原料,且各生产建筑的产出速率固定,玩家必须精确计算建筑数量比例才能避免积压或短缺。例如,面包的生产需要小麦田→磨坊→面包房的三级链条,而小麦田的数量必须与磨坊的处理速率匹配。当城市扩张至多座岛屿时,不同岛屿的地貌决定了可种植的作物种类,贸易路线便成为跨岛资源调配的唯一手段,路线设计不当会造成某类物资的区域性短缺。这种多层级、跨地理节点的约束组合,使其成为考验长程规划的高质量压力测试场景。
从结果看智能体能力的进步
最终成果——1000+ 居民、4 座岛屿、贸易路线、大部分建筑解锁——放在一个没有任何游戏专属指令的自主运行场景里,确实令人印象深刻。实验者本人也坦言「genuinely impressed」(真心感到惊讶)。
值得留意的一句话是:实验者认为 AI「本可以走得更远」,只是因为「用完了每周的 token 额度」而中断。这透露出两层信息:一是 AI 的进展并未因能力瓶颈而停滞,而是被外部资源限制打断;二是这类长时程自主任务对算力/token 的消耗相当可观,成本仍是规模化应用的现实约束。
这个实验意味着什么
把游戏当作 AI 能力的试验场并非新鲜事,但过去的 AI 玩游戏往往依赖专门训练、直接读取游戏状态或调用 API。而这个案例的差异在于:
- 通用而非专用:使用的是通用大模型,没有为该游戏做任何微调或工具适配。
- 纯视觉+通用操作:与人类玩家使用相同的信息通道和控制手段,泛化性更强。
- 自我迭代:AI 被要求「提升自己的技巧」,意味着它需要在过程中总结经验、调整策略。
如果这种能力可靠且可复现,它对 GUI 自动化、软件测试、数字助理等场景都有直接启示——一个能看懂屏幕、会操作鼠标、能长时间自主推进复杂目标的智能体,其应用边界远超游戏本身。
GUI(图形用户界面)自动化是这类能力最直接的迁移场景。传统 RPA(机器人流程自动化)工具依赖预先录制的操作脚本或固定的 UI 元素坐标,一旦界面发生变化便会失效,维护成本极高。而基于视觉语言模型的新一代 GUI Agent 理论上能像人类一样「看懂」任意界面,并根据语义目标而非像素坐标来决定操作,从而具备更强的鲁棒性和跨应用泛化能力。《纪元117》实验在某种程度上模拟了一个「极端复杂 GUI 环境」:界面元素密集、状态持续变化、操作效果存在延迟反馈,若 AI 能在此场景中保持自主推进,对企业软件操作、浏览器自动化等更结构化的场景具有较强的正向参考价值。
需要保持的谨慎
必须指出,这是一个来自 Reddit 的单一个人分享,缺乏完整的操作录像、失败案例记录和可复现的实验流程。「6 小时」「1000+ 居民」这些数字无法独立验证,其间 AI 是否有大量试错、人工干预到什么程度,都不得而知。
对这类演示,合理的态度是既承认其展示的潜力方向,也保留对具体数据和方法论的审慎。它更像是一个引人思考的能力快照,而非严格的基准测试结果。
相关推荐

AI破解370年古密码?Claude Fable 5.1的争议性突破
Hacker News 热议:AI模型Claude Fable 5.1据称破解了有370年历史的Cyphral Distich密码。本文梳理事件并分析AI在古密码破译中的能力、局限与需谨慎看待的关键点。
AI正在摧毁世界?一场关于技术狂热的争议
AI正在摧毁世界?一场关于技术狂热的争议
一篇Hacker News热帖以"AI正在摧毁世界"为标题引发讨论。本文剖析这一挑衅性表述背后的真实隐忧——内容生态污染、就业冲击与能耗代价,探讨技术批评在AI狂热时代的价值。

一双129美元鞋的退款争议为何要花掉商家229美元
为什么一双129美元的鞋子在支付争议后会让商家损失229美元?本文拆解信用卡拒付(chargeback)的成本构成,分析拒付机制对中小商家的不利影响,并提供降低争议损失的实用建议。