[控场AI]
· 5 分钟阅读· 2,929 字

Claude Opus 5.5对战GPT-6 Astra:AI游戏开发实测差距悬殊

Claude Opus 5.5对战GPT-6 Astra:AI游戏开发实测差距悬殊

Claude Opus 5.5与GPT-6 Astra同提示词开发五款游戏,Opus在3D资产与完成度上全面领先。

本文记录了一场严苛的AI编程对决:让Claude Opus 5.5与GPT-6 Astra使用同一提示词各自开发五款难度递增的游戏,全程禁止人工写代码,3D资产须由模型在Blender中自主生成。测试结果显示,Opus 5.5在画质、3D建模、UI设计、音效和整体完成度上几乎全面碾压Astra,尤其在射击游戏环节被评价"接近商业水准"。Astra并非完全失败——游戏基本可运行、光照效果有时出色——但其美术资产质量和UI打磨与Opus差距明显。核心结论是:Opus自主生成3D资产的能力是决定性优势,这一差距在单次提示词、无迭代机会的测试条件下被放大得尤为清晰。成本方面,两者在多个关卡相近,但Opus产出质量更高,且通过订阅制可大幅降低实际费用。

一场关于AI编程能力的极限测试正在展开:让Anthropic最新的Claude Opus 5.5与OpenAI旗舰模型GPT-6 Astra,用完全相同的提示词各自开发五款游戏,从难到易层层递进。开发者全程不写一行代码,所有3D资产都要求模型自己在Blender中生成、禁止从网络下载。最终结果用UP主本人的话说——"差距根本不在一个量级"。

测试规则:同一提示词,五款递进难度游戏

这场对决的规则设计得相当严苛。两个模型需要基于同一套提示词,依次构建五款难度递增的游戏:2D城堡平台跳跃游戏、与5个AI车手对战的竞速游戏、太空飞船战斗游戏、防守电台哨站抵御机器人无人机的第一人称射击游戏,以及对战巨型石头傀儡的Boss战。

关键约束条件有两个:一是所有3D资产必须由模型自己在Blender中制作,不允许下载任何现成素材;二是开发者本人不编写任何代码,完全依赖模型的自主能力。测试中Opus开启max effort(最大算力)模式,Astra开启ultra(旗舰)模式,两者都跑在各自的最高设置上。这种"单次提示词"的测试方式意味着,模型给出的第一版成品就是最终评判对象,没有反复迭代打磨的机会。

Max Effort与Ultra模式是两家公司各自为旗舰模型提供的最高推理档位。Claude的max effort模式会让模型投入更多计算资源进行自我检查和规划,类似于OpenAI的"extended thinking";GPT系列的ultra模式同理,允许模型在生成响应前进行更长链的内部推理。这类高算力模式的实际效果是:模型在面对复杂任务时会主动分解子问题、检测自身输出中的错误,并在必要时重新生成局部内容。代价是响应时间和API token消耗显著上升,这也是为什么本次测试中Opus单局成本普遍高于Astra的直接原因。对于游戏开发这类需要协调渲染逻辑、物理碰撞、AI行为多个模块的复杂任务,高推理模式的加成效果通常远比简单问答场景更为显著。

第一局2D平台游戏:UI差距初现

第一款游戏名为Rampart,是最简单的2D平台跳跃。Astra的成品本身可以运行,角色能跑动、跳跃、二段跳,还带有背景音乐,整体没有明显卡顿或故障。但问题也很明显:画面色调过于明亮、背景素材质量偏低,UI元素做得比较粗糙——这几乎成了Astra在整场测试中反复出现的通病。

Astra的API成本约为23美元

相比之下,Opus 5.5的版本被UP主形容为"天壤之别"。它不仅生成了带宝剑元素的完整logo,角色动画、光照、贴图质感都明显更胜一筹,UI界面更加干净专业,连跳跃音效都被认为优于Astra。从成本看,Opus这一局花费约48美元API成本,耗时约为Astra的两倍;Astra仅约23美元。UP主推测,如果让Astra持续迭代改进,或许能达到类似水平,但单次提示词下这就是Astra认为的"完成品"。

竞速与太空战:同等成本下的画质碾压

第二款竞速游戏Apex Circuit进入全3D领域。Astra的光照效果实际相当不错,但树木、岩石、草地等贴图偏差,且存在平衡性问题——玩家车速远快于AI对手,几乎全程领先,游戏性打了折扣。Opus版本的光照、粒子特效、车辆3D模型以及加速动画都更出色,车速也与对手更接近,游戏更具可玩性。

竞速游戏完成画面

值得一提的是这一局的成本对比:Astra约63美元,Opus约67美元,几乎持平——却换来了明显更好的成品。UP主强调,这些游戏是通过Codex和Claude的月度订阅构建的,实际并不需要按次支付高额API费用,订阅制能提供更多token额度。

第三款太空飞船游戏Void Wing延续了同样的格局。Astra的飞船和小行星模型偏基础,贴图质量一般,但机制运转正常。Opus则在3D建模上大幅领先,飞船资产、小行星贴图、音乐音效都明显更优。UP主指出,两者最核心的差距就在于Opus的3D资产制作能力远超Astra。不过他也坦言,Opus在这一局的UI表现反而与Astra接近,并非全程压制。

射击与Boss战:Opus接近商业游戏水准

第四款第一人称射击游戏Dead Signal的对比最具戏剧性。Astra的画面光照其实相当不错,射击手感流畅,但出现了一个明显bug——多数敌方无人机站着不动、不主动攻击玩家,这类问题需要回过头让模型修复。UI依旧是Astra的短板。

Opus版本的完整度更高

Opus的版本则被UP主直呼"看起来像一款能卖50美元的正规游戏"。它自带完整的加载动画和加载画面,警报音效、枪口手电光照、敌人主动攻击的AI行为一应俱全,UI和整体完成度远超Astra。UP主甚至怀疑Opus可能从网络找到了部分音效资源,而非完全自制。这一局Opus花费约50美元,Astra约32美元,但质量"完全不可比"。

最后的Boss战Colossus同样如此。Astra的铁傀儡组装动画不错,但模型有穿模问题(手会插进身体),战斗机制存在缺陷,UP主甚至"不知道怎么才能击杀Boss",怀疑游戏被写死了。Opus版本则有更精致的加载组装动画、雨天特效,以及Boss攻击时地面会破碎的细节——这些都是Astra版本所没有的。

结论:3D资产能力是决定性差距

综合五局对决,Opus 5.5在画质、3D建模、UI设计、音效和整体完成度上几乎全面领先。UP主反复强调的核心结论是:Opus最大的优势在于自主生成3D资产的能力,这一点将它与Astra明显拉开。

需要客观看待的是,Astra并非表现糟糕——它的游戏基本都能运行,光照和机制在多数情况下可用,只是在美术资产和UI打磨上明显逊色。这场测试也提醒我们两点:其一,所有成品都仅出自单次提示词,若投入一周时间持续迭代修复,任一模型都可能产出相当可观的作品;其二,通过订阅制而非按次API计费,实际使用成本会低得多。对于想用AI快速搭建游戏原型的开发者而言,这场实测给出了一个明确的参考方向。

Blender自主建模是本次测试中最关键的技术门槛。Blender是一款开源3D创作套件,支持通过Python脚本(bpy库)进行完全程序化的建模、材质赋予和渲染。AI模型生成3D资产的方式,本质上是生成一段能在Blender中运行的Python代码,由代码驱动几何体构建、UV展开和贴图绘制等操作,而非直接输出3D文件。这意味着模型需要同时具备空间几何理解、程序逻辑生成和Blender API熟练度三项能力。生成质量差的模型往往会产出几何形状过于简单的资产(如纯色方块代替树木),或UV贴图错误导致纹理拉伸变形——这正是Astra在多个游戏中暴露出的具体问题。Opus在此环节的优势,反映的是其对三维空间关系和程序化建模流程更深层的理解。

分享:

相关推荐