GPT-6 Astra实测:4个提示词造出3A级游戏与3D场景

开发者用GPT-6花1500美元测试:4条提示词造出多人射击游戏,Agent已能自测迭代,但AGI判断仍属推测。
一位提前获得GPT-6访问权的开发者,以约1500美元的测试成本,展示了当前Agent工具链的几项显著进步:用4个提示词生成《使命召唤》风格多人游戏、将PDF平面图在约一小时内转化为可玩3D地图、16分钟内制作出具备完整功能的桌面工具。GPT-6在Codex环境下表现最强,原因在于其拥有Computer Use、Browser Use及完整本机权限,能以用户登录态无缝操作各类工具。模型的自测循环能力——生成、截图评估、发现问题、自主重提示、再迭代——是作者认为最接近质变的环节。文章同时保持了一定清醒:视觉效果与工程可靠性不等同,关于AGI临近、行业硬件采购规模等判断均为个人转述或推测,读者宜分层看待可复现的具体成果与基于主观体验的宏大推断。
一位提前一周拿到访问权限的开发者,在 OpenAI 发布代号 Astra 的 GPT-6 后,花掉约 1500 美元 credits 做了各种尝试。他的结论颇具冲击力:只用 4 个提示词做出一款《使命召唤》风格的游戏,第 5 个提示词把它改成多人模式,随即在直播里和 20 个人一起玩了起来。这篇文章梳理他分享的几个核心体会,也试着分辨哪些是真实进步、哪些是兴奋之下的过度乐观。
AI 在 3D 图形上的能力被严重低估
作者提出的第一个判断很直接:在 3D 图形这件事上,AI 已经比大多数人类做得更快更好。
他做了一个具体实验——从网上找到一份庄园的 PDF,里面有大房子、庄园介绍甚至平面图。他把这份文档交给模型,让它在 Blender 里把整栋房子建出来,检查无误后再把这栋房子做成《使命召唤》游戏里的一张新地图,命名为 Estate,玩法格式对齐此前做的 Call of Singularity。大约一小时后,模型返回了 Blender 场景,也返回了可以直接进去玩的 Modern Singularity 地图,里面甚至加了一架能飞、能开枪、也会被别人击落的直升机。

这类能力不止用于游戏风格。作者提到 X 上出现的趋势:有人用 Codex 和该模型做逼真的 3D 教育渲染,比如把特斯拉某个零件按部件逐一拆解展示,还能放大看每一块是什么、做什么,并在组装态和拆解态之间来回切换。他由此推断,数字资产的制作正在快速去稀缺化——真正稀缺的,是把这些资产变成现实里有用的东西,比如结合 3D 打印。
需要冷静看待的是,作者本人也承认无法判断这些工业渲染的准确性,因为他不是引擎专家。视觉上的震撼与工程上的可靠,是两回事。
Blender 是一款开源的三维创作套件,支持建模、材质、渲染、动画和游戏资产导出等完整工作流。传统上,将一份 PDF 平面图转化为可玩的游戏地图,需要经历「建筑建模→UV 展开→材质贴图→引擎导入→碰撞体积设置→游戏逻辑编写」等多个高度专业化的环节,每个环节都需要对应领域的熟练技能,整体周期通常以天或周计。文章所描述的流程——将 PDF 直接交给模型,约一小时后获得可玩地图——意味着模型不仅要理解平面图的空间关系,还要完成上述全部工程步骤,并以代码或脚本形式驱动 Blender 执行。这正是令从业者惊讶的地方:以往每个环节都是独立的瓶颈,而 Agent 工具链把它们压缩进了一次连续的自动化流程。
Web Coding 被“解决”了?按需生成软件的门槛趋近于零
第二个体会更贴近日常开发:作者认为“Web Coding 已经被解决”,可以直接按需生成软件,做个人工具的门槛几乎为零。
他举了一个当天早上的例子。在咖啡店做演示稿时,他厌倦了反复去 Google 图片找图、拖下来、抠背景、再粘回演示的流程,于是让 Codex 做一个类似 Raycast 的桌面应用:用快捷键唤起、能搜 Google 图片、能自动去背景、复制或保存的内容自动进入指定文件夹。他称结果只花了 16 分钟就做出来,按 Command+Shift+Space 唤起,输入关键词即可搜索。后续他还追加了多关键词并行搜索、以及用 AI 自动把一段文本拆成多个精确搜索词的功能。

他同时看好“获客页面”这类轻量场景。为了让人方便注册 Call of Singularity,他直接让模型按游戏风格搭一个站并部署到 ChatGPT Sites,还要求只给自己的邮箱开放一个管理员后台,用来查看谁提交了信息。

作者由此延伸出一个商业设想:如果有平台能让创作者免费托管自己做的游戏、并支持游戏内货币和交易,这会像 Roblox 但创作限制更少,可能催生下一波 Web Coding 热潮,创作者会像做 PDF、课程、社群那样为受众做游戏和小世界。这部分属于个人推测,尚无产品落地佐证,宜作为趋势观点而非事实看待。
自测循环:Agent 会自己玩游戏来验证结果
真正让作者觉得“AGI 快了”的,是模型的自我评估能力明显增强。你交给它一个任务,它会完成、评估自己做得如何、判断哪里要改、再修改、反复重新评估。
在做那张 Blender 地图时,模型先生成地图、再在 Blender 里截图查看,判断当前状态能否成功构建进游戏,然后把载具系统扩展成直升机登机功能,接着直接开一局比赛、以角色身份在地图里移动、检查那栋房子。他提到一开始房子特别白、纹理不对,模型发现问题后会重新给自己下提示,在“测试—评估—再提示”的循环里迭代到满意状态。

这种能力在“电脑操作”维度也在快速提升。作者引用了一个对比测试:让新模型和上一代模型各自打开 Microsoft Paint 照着自己的照片画画,差距明显。他还提到行业背景——据称 OpenAI 买了数万台 Mac Mini 和 Mac Studio 做强化学习和 Computer Use Agent 训练,Anthropic 则通过 AWS 租用 Mac Mini,两家都有成千上万台机器全天候运转用于训练和评估 AI 控制电脑的能力。这些数字来自作者转述,未经独立核实,读者应保留一定怀疑。
这种「生成→评估→再提示」的循环在 AI 领域通常被称为 Agentic Loop 或 ReAct(Reasoning + Acting)范式。与传统的单次问答不同,Agent 在每一步行动后都会观察环境反馈(如截图、报错信息、运行日志),将其纳入下一步的推理上下文,从而形成闭环迭代。关键的区别在于「感知」来源:文字聊天中模型只能依赖用户描述,而拥有 Computer Use 权限的 Agent 可以直接截图获取视觉状态,这使它能发现用户自己都未察觉的问题(如纹理偏白、碰撞体积错误)。这种自主纠错能力是当前 Agent 工具链相比一年前最显著的质变之一,也是作者将其与「AGI 临近」挂钩的主要依据——尽管从任务型自测到通用智能之间的距离,学界仍存在相当大的分歧。
为什么是 Codex,为什么是 Mac Mini
作者强调,同一个模型在 Codex 里的表现明显更强。虽然你也能在 Cursor 里用 GPT-6,但这个模型是为 Codex Harness 及其工具链设计的:Computer Use、Browser Use(本地启动浏览器、快速填表、测试网站)、截图回传、做游戏、搭网站、增删移动文件——基本上你电脑上能做的事它都能做。
关键在于权限与登录态。因为它跑在你自己的电脑上、拥有完整访问权,登录了 GitHub、Vercel 等工具,能拿到你的 API keys,所有浏览器标签页都是登录状态,所以它处理事情又快又顺。这既是它强大的原因,也是显而易见的安全隐患——把完整电脑控制权交给一个 Agent,风险与效率是同一枚硬币的两面。
由此他推出最后一个体会:Mac Mini 方案依然最强。他新买了一台 Mac Mini,加上一台 Linux 机器,打算让 Codex 常驻运行,用手机或 iPad 远程控制,实现“随身可用、7×24 运转”的 Codex 实例。他计划本周搭建并录一期视频,把 Anthropic、Grok 等 Agent 也一并跑在这套配置上。
Computer Use 和 Browser Use 是两类不同的 Agent 能力接口。Computer Use 指模型通过截图感知屏幕状态、再模拟鼠标键盘操作来控制任意桌面应用,最早由 Anthropic 在 2024 年底随 Claude 3.5 Sonnet 更新公开演示,随后各家跟进。Browser Use 则更聚焦于浏览器自动化,能在已登录的浏览器会话中填写表单、提取数据、触发页面交互,相比无头浏览器脚本(如 Selenium、Playwright)的优势在于可以利用已有的登录态,无需重新处理验证码或 OAuth 流程。两者结合后,Agent 能以用户身份无缝操作几乎所有 SaaS 工具,这正是文章中「又快又顺」的技术原因,也是作者反复强调「权限=能力」这一等式的底层逻辑。
结语:兴奋之外,需要一份清醒
作者的整体判断是,我们正处在指数级增长阶段,AI 控制电脑的能力和智能会持续变强,“AGI 时代正在到来”。他甚至认为第一个门槛在上一代 Cloud Code 发布时就已被跨过,只是当时没人立刻察觉。
作为读者,值得把这份分享拆成两层看:一层是可复现的具体成果——4 个提示词生成游戏、16 分钟做出桌面工具、PDF 转 3D 转游戏地图,这些是实打实的能力演示;另一层是基于个人体验的宏大推断——AGI 临近、创作者游戏经济崛起、行业硬件采购规模等,缺乏独立验证。前者足以说明当前 Agent 工具链的进步确实惊人,后者则更适合当作激发想象的观点,而非既定结论。
相关推荐

Claude诡异幻觉实录:AI角色错乱与自问自答现象解析
一位大学生用Claude学习德语时遭遇诡异幻觉:AI角色错乱、自称生病未成年、甚至自问自答,每句都以"um"开头。本文解析这类AI幻觉与角色边界崩溃的技术根源及应对方法。

Pony/Illustrious模型姿势提示词攻略:从关键词到LoRA训练
如何在Pony、Illustrious等模型中生成特定姿势?本文从Danbooru标签、描述性提示词、ControlNet OpenPose到LoRA训练,梳理AI绘画姿势控制的完整实操路径与避坑指南。

实测 GPT-6 Astra 智能体:一句提示词自主完成广告与纠错
实测 GPT-6 Astra 智能体在 Higgsfield 上仅凭一句提示词自主完成广告制作、自我审片纠错、保存技能并诚实开账单,深度解析其计算机操作能力、真实成本与人类角色的变化。