[控场AI]
· 7 分钟阅读· 3,719 字

Claude Opus 5.5实测:从草图到3D世界,AI重塑游戏开发

Claude Opus 5.5实测:从草图到3D世界,AI重塑游戏开发

Opus 5.5借助多代理框架,将文字和草图转化为可玩3D交互体验,但代价是高昂的时间与token成本。

Anthropic的Opus 5.5展现出一种新型AI编程范式:不再只是生成零散代码,而是将文字描述、手绘草图转化为可交互的3D游戏原型与物理仿真场景。文章梳理了五个典型演示,涵盖交互式镜头实验室、浏览器篮球游戏、可探索热带岛屿、草图转物理仿真,以及蜘蛛侠式荡绳游戏。这些成果普遍依赖Three.js、GenX Games等代理工具协同,AI扮演的是多代理开发流程中的「大脑」而非全能创作者。成本方面,案例从25美元到近1900美元、耗时数小时不等,成果也存在明显bug与画质瑕疵,距离商业级作品仍有差距。核心趋势是:AI编程的问题已从「能否写代码」转变为「能否把脑中构想变成真正能玩的东西」。

Anthropic 在业界呼吁「放慢 AI 发展速度」的声音中,转身推出了 Opus 5.5。B站 UP 主 Pursuing AI 在其研究报告视频中,展示了这款模型的一系列生成成果——从交互式物理模拟到完整的可探索 3D 世界。这些案例揭示出一个明确趋势:AI 编程正从生成零散代码片段,转向构建越来越完整的可交互体验。

本文基于该视频内容,梳理 Opus 5.5 最具代表性的几个演示,并剖析背后的能力边界与真实成本。

交互式镜头实验室:把抽象概念变成可玩演示

第一个案例来自用户 Rianne Sayer,他让 Opus 5.5 搭建一个交互式镜头实验室来解释相机对焦原理。模型没有输出一大段文字说明,而是直接构建了一个可视化交互模拟——完整的镜头结构、各个镜片、焦平面、背景场景,以及可调节参数的控制按钮。

最精彩的部分在于,当你移动焦点时,模型会直观展示清晰平面在场景中如何移动。你不再是干巴巴地读景深解释,而是能亲眼看到概念在眼前发生。

值得关注的是成本数据:据发帖者透露,生成这个内容耗时 1 小时 26 分钟,API 费用为 25.66 美元。这不是几秒钟蹦出来的简单网页,而是消耗了大量时间和算力的产物。真正令人印象深刻的,并非生成了一个好看的界面,而是模型把「解释对焦」的教学需求,转化成了结构化的交互式可视化。

当然,这并非完美的物理模拟器,而是一个为特定教学目的精心打磨的互动演示。就这个目标而言,它确实做到了文字难以企及的效果。

浏览器篮球游戏:从想法到可玩的3D原型

第二个案例是一款基于浏览器的篮球游戏。创作者让 Opus 5.5 做一个类似 NBA 2K 的体验,最终成果包含 3D 篮球场、可操控角色、篮球、计分牌、投篮计时器,以及投篮机制、移动操作和实际的投篮系统。

角色在球场上跑动

关键区别在于,这不是静态模型——视频中角色能在球场上跑动、运球、投篮并与游戏互动。需要说明的是,这并非在浏览器里运行 NBA 2K。帖子明确提到,成果是用 Three.js 加上 GenX Games 的代理游戏开发工具做出来的。因此 Opus 5.5 的贡献应被理解为整个开发流程的一环,它通过代码和代理工具辅助生成游戏,而非独立提供所有素材、系统和基础设施。

与真正的 NBA 2K 相比,这个原型画面更简单、动画更基础、玩法系统也有限得多。但重点在于:你只需说「给我做个篮球游戏」,就能得到一个能用的 3D 浏览器原型。这与单纯让 AI 生成几行 JavaScript 代码的体验,已是完全不同的层级。

Three.js 是一个开源的 JavaScript 3D 图形库,允许开发者直接在浏览器中通过 WebGL 渲染三维场景,无需安装任何插件。它封装了底层 GPU 调用,提供相机、光照、材质、几何体、动画等高层 API,是浏览器端 3D 游戏和可视化的主流选择。GenX Games 的代理游戏开发工具则代表了一类新兴的「AI 代理框架」:这类框架将大语言模型拆解为多个可以自主规划、调用工具、相互协作的「子代理」,每个子代理负责一个子任务(如生成地图、编写物理逻辑、调试碰撞检测),最终汇总输出完整工程。理解这一点很关键——案例中展示的并非 Opus 5.5 单次生成整个游戏,而是它在一套代理框架下充当「大脑」,持续拆解任务并驱动多轮代码生成与迭代。

可探索的热带岛屿:接近1900美元的完整环境

最能体现规模上限的,是用户 Dan Green 分享的热带岛屿环境。他花费了 1874.40 美元的 Opus 5.5 代币——将近 1900 美元——打造了一个可游玩的岛屿场景。

据其描述,你可以在岛上四处走动、探索海滩、走到码头、乘船出行,甚至潜入水下。环境细节相当丰富:房屋、植被、海洋、码头、船只,还有光照变化和完整的昼夜交替。到了夜晚,灯光会照亮码头和周边区域;潜入水下则能看到鲸鱼等海洋生物。多种系统被整合进一个互动体验中。

岸边波浪在某些地方看起来仍有瑕疵

作者自己也坦承项目存在 bug 和画面瑕疵,部分贴图有待优化,岸边波浪某些地方看起来有点怪。这显然不是商业级打磨过的开放世界游戏。

更值得玩味的是制作方式:整个过程用了多个子代理,API 运行约 2 小时 7 分钟,换算成现实时间约 8 小时。作者表示自己几乎没给技术指导,提示词大多很简单,比如「加上这个」或「这里看着不对劲,改好点」。AI 承担了绝大部分的构建和迭代工作。但这也说明,一句话生成 3A 大作并不现实——背后是实打实的算力投入、多代理协作和数小时迭代。

文中提到的「token 成本」是理解 AI 使用费用的基础概念。大语言模型以「token」为计费单位,token 是文本被分词后的基本单元,一个英文单词大约对应 1–2 个 token,中文字符通常每字对应 1–2 个 token。Anthropic 的 API 按输入和输出 token 数量分别定价。对于涉及大量代码生成、多轮对话和多代理协作的复杂任务,模型需要在每一步读取完整的上下文(输入 token),再生成新内容(输出 token),两者叠加后成本会随项目规模急剧上升。热带岛屿案例花费近 1900 美元,正是因为多个子代理在约 8 小时内持续迭代,每一轮都累积了大量 token 消耗。这也意味着,此类复杂项目的实际成本在规划阶段就需要认真评估。

草图转仿真:视觉概念到结构化物理系统

草图转仿真的演示,展示了另一种独特能力。创作者先画了一张手绘草图,上面有投射机、投射物和一对方块,随后 Opus 5.5 将其变成了可交互的 3D 仿真场景。

投射物击中后方块做出反应倒下

这不只是把画变成 3D 模型。投射机像真正的物理系统一样运作——你可以调整参数、查看投射物轨迹,然后发射出去,投射物击中方块后方块会倒下,过程中还会显示质量、速度等测量数据。

真正的跨越在于:模型把视觉概念转化成了结构化环境,并在此基础上添加了行为与模拟功能。这远比从草图生成一张静态图像复杂得多。虽然无法验证其物理计算是否完全符合现实,但作为能力展示已足够说明问题。

「草图转仿真」背后涉及多模态输入能力:模型不仅要「看懂」手绘图像中各元素的位置关系与语义(哪个是投射机、哪个是目标),还要将这种视觉理解映射到结构化的代码表示——包括场景图、物体属性、物理引擎参数等。现代物理仿真通常依赖 Cannon.js、Ammo.js 或 Rapier 等 JavaScript 物理引擎,它们负责计算刚体碰撞、重力、速度衰减等行为。Opus 5.5 在此扮演的角色是「翻译层」:把视觉概念解析为引擎可理解的参数配置,再包裹成完整的可交互场景。这与纯文本代码生成有本质区别,要求模型同时具备图像理解、空间推理和物理建模三种能力的协同。

蜘蛛侠式荡绳游戏:从零生成的完整3D城市

视觉效果最震撼的,是一段用 Opus 5.5 Medium 制作的 Three.js 游戏演示。创作者称所有三维模型、纹理和动画都是从零开始制作的,成果是一款设定在大型三维城市中的蜘蛛侠式荡绳游戏。

角色松开蛛丝在楼宇间穿梭

你可以在屋顶奔跑、楼宇间跳跃、在街道中荡绳攀爬玻璃幕墙。最令人印象深刻的是环境一致性——这不是单一场景,整段游戏中城市始终如一,包含建筑、道路、车流、树木、行人、路灯和远处天际线,还配有小地图、任务目标等真实界面。

荡绳玩法是最大亮点:角色附着在建筑上、绕拐角摆动积蓄动量,再松开蛛丝在楼宇间穿梭。当然它比不上《蜘蛛侠 2》,动画更简单、模型重复性高、物理效果也不专业,NPC 和环境存在视觉重复。但对 AI 辅助开发流程而言,能把「脑中的游戏描述」变成真正能玩的东西,已经相当接近目标。

AI 编程的方向:从写代码到造世界

这些案例只是 Opus 5.5 能力的一部分。从交互模拟、浏览器游戏到完整的 3D 世界,最引人注目的转变在于:我们不再只是让 AI 写代码,而是让它把一个想法变成看得见、用得着、能互动的东西。

必须清醒看待其局限:演示普遍耗时较长,依赖多个智能体和辅助工具,token 成本从几十美元到近两千美元不等,成果也存在明显 bug 和画质瑕疵。别指望描述一下下一部 GTA,5 分钟就能变出完美游戏。

但大方向已经明确——AI 编程正从生成零散代码片段,转向构建越来越完整的互动体验。核心问题不再是「AI 能不能写代码」,而是「你能否把脑中的构想描述出来,让 AI 把它变成真正能玩的东西」。Opus 5.5 的这些演示,正让这个问题的答案逐渐清晰。

分享:

相关推荐