Claude Fable 5.1实测:一句话生成Minecraft、Garry's Mod、马里奥64

近期,一位B站UP主对Anthropic最新发布的Claude Fable 5.1模型进行了一次极限压力测试:在Claude Code环境中,用**单条提示词(one-shot prompt)**分别生成《我的世界》(Minecraft)、《盖瑞模组》(Garry's Mod)和《超级马里奥64》三款风格迥异的经典游戏。测试结果令人震撼,UP主甚至给出了自己评测生涯中的首个9.9分。
所谓one-shot prompt(单次提示),是指用户仅向AI模型发送一条完整的指令,模型在不经过多轮对话修正的情况下一次性完成全部任务。这与传统的AI辅助编程工作流形成鲜明对比——后者通常需要开发者反复与模型交互,逐步迭代代码。单次提示对模型的要求极高,因为它需要模型在一次推理过程中完成需求理解、架构设计、代码编写、模块集成等所有环节,任何一步出错都无法通过后续对话补救。
本文将梳理这次实测的完整过程,并从AI代码生成能力的角度分析Fable 5.1的真实水平与局限。
测试环境:Claude Code搭配Ultra Code模式
本次测试全部在Claude Code中完成,模型切换为Fable 5.1,并将运行档位调至最高的Ultra Code模式,以充分释放模型的编码性能。
Claude Code是Anthropic推出的面向开发者的命令行编程工具,它允许Claude模型直接在终端环境中读写文件、执行命令、运行项目,而不仅仅是在聊天窗口中输出代码片段。Ultra Code模式是其最高性能档位,通常意味着模型会消耗更多计算资源(更多token额度、更长的上下文窗口、更深的推理链),以获得更高质量的代码输出。这种模式特别适合需要生成大规模、多文件项目的复杂任务。
测试方法非常直接:将预先准备好的完整游戏需求提示词一次性粘贴发送,等待模型自动生成可运行的本地项目,再通过localhost打开体验。
有意思的是,整个流程没有多轮迭代、没有人工修bug——每款游戏都是单条prompt一次成型。这也是本次测试最具冲击力的地方:它检验的不是AI辅助编程的效率,而是模型从零到可玩产品的端到端代码生成能力。
Minecraft克隆「Hune」:体素沙盒的高度还原
生成的体素沙盒游戏被命名为「Hune」,进入创造模式后,UP主的第一反应是「这是我见过最疯狂的一次性Minecraft克隆」。
要理解这一成果的含义,需要先了解体素引擎的技术复杂度。体素(Voxel)是三维空间中的最小立方体单元,类似于二维图像中的像素。Minecraft风格的体素引擎看似简单,实际上涉及大量技术挑战:需要高效的区块(Chunk)加载与卸载机制来管理内存;需要贪心网格合并(Greedy Meshing)算法减少渲染面数;需要实现方块面剔除(仅渲染暴露在空气中的面)来优化性能;还需要光照传播系统来计算每个方块的亮度。一次性生成一个可运行的体素引擎,意味着模型需要同时处理好这些相互依赖的子系统。
从实测表现看,Fable 5.1在细节还原上确实惊人:
- 地形生成:具备正常的程序化地形,甚至出现了「巨型山脉」和真实的洞穴生成
- 方块系统:钻石剑外观与功能都还原到位,玻璃可以透视
- 交互体验:挖掘手感被评价为「非常令人满足,和Minecraft一模一样」,斧头挖掘速度更快、造成伤害更高
- 生存模式:昼夜循环、游泳、生物(鸡、猪)都已实现,甚至能通过搜索栏查找方块
- 合成系统:完整实现了合成台功能
其中,程序化地形生成(Procedural Terrain Generation)是游戏开发中的经典技术,其核心思想是通过数学算法(而非手动建模)自动创建地形。Minecraft使用的是基于Perlin噪声和Simplex噪声的多层叠加算法,通过不同频率和振幅的噪声函数组合,生成起伏自然的山脉、平原和洞穴。洞穴生成则通常使用Perlin Worm算法或3D噪声阈值切割。Fable 5.1能在一次性生成中实现这些算法,说明模型对过程式生成的数学基础和工程实现都有深入理解。
当然也存在明显缺陷:水流不流动,只是单个静态方块;火把摆放略有错位;沙子破坏后不会下落。但对于一次性生成的产物而言,这些瑕疵已被UP主认为「无伤大雅」。
Garry's Mod物理沙盒「Construct」:物理引擎的真实运作
第二款生成的物理沙盒游戏名为「Construct」,规模明显超出预期——地图比UP主此前测试时大得多,背景有完整的场景,还专门设置了一个「跌落测试中心」。

最让人意外的是游戏内文本渲染质量。UP主指出,过去AI生成的游戏文字往往扭曲、别扭,而这次的UI文本「看起来非常棒」,这从侧面反映出Fable 5.1在结构化界面生成上的进步。
物理系统方面,工具枪、焊接枪、推进器、气球、绳索、复制、喷漆等Garry's Mod招牌功能一应俱全。物体可以抓取、冻结、旋转、缩放。UP主用金属桶焊接推进器尝试「起飞」,虽然过程中箱子被撞碎、载具反复失败,但最终还是靠焊接座椅和推进器组合搭出了能飞的载具。

随后他又尝试给冰箱装轮子做成汽车,遇到了轮子半径不够、重量分布失衡等物理问题——但这恰恰说明物理引擎是真实运作的,而非简单的动画模拟。

物理引擎是模拟现实世界物理规律(重力、碰撞、摩擦、刚体动力学等)的软件系统。Garry's Mod原版使用的是Valve的Source引擎内置的VPhysics物理系统,能够模拟刚体碰撞、约束连接(焊接、绳索、铰链)和力的传导。UP主测试中遇到的"轮子半径不够、重量分布失衡"等问题,恰恰证明生成的物理系统在进行真实的力学计算——物体有质量属性,力矩和重心会影响运动结果。如果只是播放预设动画,就不会出现这类符合物理直觉的"失败"。这是区分真正物理模拟与视觉伪装的关键标志。
最终,UP主靠推进器加斜坡完成了「飞车」壮举,称这是「目前见过最强的一次性提示词生成结果」。

超级马里奥64重现:从后空翻到Boss战的完整关卡
第三款是UP主此前挑战失败过的《超级马里奥64》。这一次Fable 5.1生成的版本表现出乎意料地完整。
《超级马里奥64》于1996年发布,是3D平台跳跃游戏的开山之作,其动作系统的设计至今被视为教科书级别。马里奥拥有超过20种不同的移动状态(行走、奔跑、跳跃、后空翻、侧翻、踢墙跳、俯冲等),这些状态之间的切换由复杂的有限状态机控制。后空翻需要检测角色处于蹲下状态时的跳跃输入,踩踏敌人需要精确的碰撞检测判断攻击方向。Boss战中"绕后抓取并投掷"的机制更涉及NPC的AI追踪逻辑、抓取判定区域和投掷物理计算。一次性生成还原这些复杂交互逻辑,对模型的游戏设计知识储备和代码实现能力都是严峻考验。
初始版本存在控制方向相反的小bug,简单调整后即可正常游玩。实测中发现的功能包括:
- 3D动作系统:后空翻、转向、踩踏Goomba头部都能正常触发
- 关卡设计:具备完整的可攀爬山地关卡、红币收集、移动平台
- Boss战:需要绕后抓取并投掷的经典Boss机制被还原
- 火炮系统:需要炸弹小子开启的火炮、瞄准发射机制均已实现
- 收集与通关:能够收集星星并完成整个关卡
UP主全程通关后评价这是「一个真正好玩的游戏」,操作手感和关卡节奏都相当扎实。
AI一次性代码生成能力的意义与边界
这次实测虽然带有明显的娱乐性质,但背后反映出的技术信号值得关注。
端到端产品生成能力的突破
过去我们评价AI编程模型,更多看它能否补全函数、修复bug、辅助重构。而Fable 5.1展现的是从一段自然语言需求直接产出可运行、可交互、带完整游戏循环的复杂应用——这涉及渲染、物理、UI、游戏逻辑等多个系统的协同实现。
生成一个完整的可运行游戏,代码量通常在数千到数万行之间,涉及渲染模块、输入处理、物理计算、游戏状态管理、UI系统、音效系统等多个相互依赖的子系统。这要求模型在生成过程中始终维持对整体架构的认知——前面定义的数据结构必须与后面的使用方式一致,函数接口必须在调用处和定义处匹配,全局状态的修改必须在所有相关模块中保持同步。这种"长距离一致性"是大语言模型面临的核心挑战之一,因为模型本质上是逐token生成的,越靠后的代码越难与前文保持严格对齐。Fable 5.1能实现三款游戏的一次成型,表明其在长序列代码生成中的规划与一致性维护能力取得了显著进步。
三款风格迥异的游戏都能一次成型,说明模型的长上下文规划与代码组织能力有了实质提升。
仍需正视的现实局限
从测试可见,模型的产物在物理细节(水流不流动、沙子不下落)、边界情况(控制反向、载具重量失衡)上仍有明显缺陷。这些游戏是「高度还原的原型」,而非「可发布的成品」。此外,本次测试仅来自单一UP主的实测演示,缺乏系统性benchmark对照,其「碾压所有基准测试」的说法应视为营销话术而非严谨结论。
对开发者的实际启示
AI已经能够将「概念验证」和「快速原型」的成本压缩到极低。以往需要数天搭建的游戏demo,如今一条提示词、几分钟等待即可获得可玩版本。这对独立开发者、教育演示、创意验证等场景具有实际价值,但从原型到打磨完善的商业产品,人类工程师的深度介入依然不可替代。
结语
Claude Fable 5.1在这次三款游戏的一次性生成测试中,交出了一份足以让评测者惊叹的答卷。它清晰地展示了当前顶尖AI代码模型在复杂应用端到端生成上的进步,也暴露了在物理精度和边界处理上的现实局限。对于关注AI编程发展的人而言,这类实测比抽象的benchmark数字更能直观感受模型能力的真实边界。
相关推荐

AI Agent成本优化实战:一小时省下百万美元的工程智慧
Databricks工程团队仅用一小时消除每年100万美元的AI Agent无效支出。本文深度解析Agent成本失控的根源、可观测性驱动的优化方法,以及模型分级、上下文精简、缓存去重等关键策略,为团队提供AI成本治理的实践指南。

FDA如何在Databricks上构建AI就绪的数据底座
深入解析FDA如何借助Databricks for Government平台,在保障联邦级安全合规的前提下,构建统一的湖仓架构与AI就绪数据底座,破解遗留系统数据孤岛难题,为药品监管和公共卫生AI应用奠定基础。

安全协作的力量:为什么漏洞发现离不开人的智慧
探讨安全协作如何胜过单纯依赖工具,解析漏洞背后的故事价值、跨团队知识共享实践路径,以及如何通过投资于人与协作来构建更强大的安全防线。