GameAgent对决Pink:游戏开发AI智能体三轮实测

GPT-5.6驱动的GameAgent与Pink在Cocos Creator上进行三轮游戏开发对决,稳定性成核心差距。
本文评测了两款基于Cocos Creator的游戏开发AI智能体——GameAgent(0.3.4)与Pink(0.0.1.36 Alpha),在统一接入GPT-5.6 Sol模型的条件下,经过Hello World基础代码、贪吃蛇完整玩法、平台跳跃关卡搭建三轮递进测试。第一轮GameAgent因欢迎语切换等交互细节小胜;第二轮两者均实现基本玩法,判定持平;第三轮Pink连续遭遇请求失败而中断,仅GameAgent展示了阶段性成果。评测结论指出,当前游戏开发智能体在简单代码和小游戏原型上已具备可用性,但面对场景搭建、素材理解和复杂工程管理时,稳定性问题显著,仍需人工纠偏,更适合作为提效工具而非完全托管的开发者。
游戏开发正在成为AI智能体落地的新战场。这次评测把两款运行在Cocos Creator上的开发智能体——GameAgent与Pink——放到同一张考卷前,用三道难度递进的题目检验它们的实战能力。两者都接入同一模型(GPT-5.6 Sol),推理等级统一设为高,尽可能排除模型差异,专注比较智能体本身的工程能力。
两位选手与测试设置
GameAgent是运行在Cocos Creator里的插件,本次使用0.3.4版本;Pink则在自己的编辑器里提供游戏开发与对话操作,使用录制时最新的0.0.1.36 Alpha版本,配合Cocos Creator 3.8.8。需要强调的是,Pink目前处于Alpha内测阶段,本次表现不代表最终品质。
评测方法值得肯定:每一轮不仅看最终交付的成品,还完整记录开发过程——读取工程、编写脚本、绑定组件、打开预览、执行交互。这种“过程+结果”的双重视角,能更真实地反映智能体在实际工作流中的表现,而不是只看一张漂亮的截图。
Cocos Creator 是由触控科技开发的跨平台游戏开发引擎,基于组件化与数据驱动的设计理念,支持 2D/3D 游戏开发并能发布至 Web、iOS、Android 等多个平台。其核心工作流围绕"场景-节点-组件"三层结构展开:开发者在场景编辑器中摆放节点,再为节点挂载脚本组件来实现逻辑。这一架构对游戏开发智能体来说既是机遇也是挑战——智能体不仅需要会写脚本代码,还必须理解节点层级、预制体(Prefab)复用机制以及资源绑定关系,才能真正把代码"接入"可运行的场景,而不是只生成孤立的 .ts 文件。本次评测中第三轮暴露的难点,正是源于场景搭建对工程结构理解的高要求。
第一轮:Hello World 基础代码
第一轮是热身,题目只有一句话:写一个Hello World的游戏,不指定具体界面。考察点集中在基础代码能否运行、点击后有没有正确反馈。
两边都要读取工程、安排实现、再把脚本接入场景。GameAgent较早给出了带标题、说明和按钮的预览截图;Pink则持续修改文件、处理组件绑定。等两个版本都能操作后,再对照点击计数、文字变化和按钮反馈。

结果上,Pink的点击计数可以更新,按钮有反馈,基础交互成立。GameAgent除了计数,每次点击还会切换欢迎语,互动内容多了一层。按实际交出的内容,这一轮GameAgent小胜,差距主要在额外的交互细节而非核心功能。
第二轮:贪吃蛇完整玩法
第二轮考察完整游戏设计与开发能力,需求仍是一句话:一个贪吃蛇小游戏,界面和规则细节交给智能体安排,重点看移动、吃食物、计分、失败和重新开始能否连成一套可游玩流程。
这一轮的难点在于要把此前的点击演示改造成持续运行的游戏循环。GameAgent把棋盘、分数和方向按钮分区摆放,画面元素较多;Pink则继续生成游戏逻辑与界面,风格相对简洁。两个智能体都具备预览和测试能力,一边检查运行状态、执行交互,另一边打开浏览器截取画面检查预览。

过程中Pink遇到了异常,任务没有完整跑完,但已生成的贪吃蛇仍可游玩,评测者补录了一段实际操作。最终两边的基本玩法都成立:蛇的移动、计分、游戏结束都能看到。GameAgent画面元素更丰富,Pink更简洁,这一轮判定为基本持平。
第三轮:场景搭建与素材理解
第三轮最能拉开差距,也最考验智能体对工程结构的掌控。两边拿到现成的角色、平台、金币和敌人素材,目标是做一个竖版平台跳跃关卡,玩法要求包括二段跳、收集金币和踩敌人。核心考察点是:智能体如何理解素材,并把它们真正搭进场景。
这里评测者做了一次纠偏——两边原本都没打算搭建场景,而这恰恰是本轮重点,因此明确要求必须把场景搭出来,必要时使用预制体以便复用。这段人工引导被如实保留在结果中。

GameAgent的场景层级逐步增加,平台、金币、敌人和玩家都能在工程中找到,资源区也出现了相应的预制体。Pink则连续遭遇请求失败:第一次尝试失败后重新发起,第二次、第三次仍报错,给了两次机会依然没能拿到可供演示的结果。
需要客观说明的是,Pink本次任务是被异常阻断,不能据此判断它的场景搭建能力本身。第三轮因此没能形成完整对比。
预制体(Prefab)是 Cocos Creator 中一种可复用的节点模板,将节点连同其子节点、组件配置一起打包存储为独立资源。在关卡设计中,同类对象(如金币、敌人)通常以预制体形式管理,运行时动态实例化,既节省手动摆放的工作量,也便于统一修改属性。对游戏开发智能体而言,能否主动识别"这类对象应该做成预制体"并正确创建、引用,是判断其是否真正理解 Cocos 工程结构的关键指标之一。评测中评测者专门要求智能体使用预制体,本身就反映出:在没有明确指令时,智能体倾向于直接在场景中静态摆放节点,而非采用更工程化的复用方案。
GameAgent 单独展示
由于Pink未能完成,第三轮只能单独看GameAgent。它继续处理场景、脚本和预览检查。中途也有代码子任务失败,这些异常同样如实保留,随后继续处理控制脚本。

从阶段性体验看,角色可以在场景间移动和跳跃,顶部显示分数、金币和生命值,踩中史莱姆后还有加分提示。两次体验表明关卡已经可以操作,场景结构也能继续编辑。但录制结束时,GameAgent的任务仍未全部结束,展示的只是阶段性结果,后续验收还需继续。
评测总结与观察
三轮下来,结论清晰又保留余地:
- 第一轮:两边都完成基础交互,GameAgent因欢迎语切换等细节小胜。
- 第二轮:基本机制都做出来了,判定持平。
- 第三轮:Pink遭遇异常未能完成对比,仅GameAgent展示了阶段性成果。
这场“赛博斗蛐蛐”最有价值的地方,并不在于分出绝对胜负,而在于它暴露了当前游戏开发智能体的共性瓶颈:越复杂的任务(尤其涉及场景搭建、素材理解和多对象工程管理),越容易出现请求失败、子任务中断等稳定性问题。GameAgent在完整度和交互细节上略占优势,而Pink作为Alpha内测产品,稳定性还有明显提升空间。
对开发者而言,这类智能体已经能胜任简单代码和小游戏原型,但在生产级的场景组织与复杂逻辑上,仍需人工纠偏与验收。它们更像是提效工具,而非可完全托管的开发者。
相关推荐

NVIDIA TensorRT Model Connect:两行命令部署开源模型
NVIDIA TensorRT Model Connect 让开源模型部署仅需两条命令,无需 ONNX 转换。支持 LLM、扩散、视频生成等多类模型,兼容 RTX 消费级 GPU,并新增双 DGX Spark 多设备推理能力。

NVIDIA cuML 加速谱聚类:Scikit-Learn 提速100倍实测
NVIDIA cuML 让 Scikit-Learn 谱聚类无需重写代码即可在 GPU 上运行,大规模数据下提速超 200 倍。本文解析其原理、接入方式及在金融期权数据中的实测表现。

谷歌DeepMind成立新机构:把AGI大辩论摆上台面
Google DeepMind成立新机构,旨在把通用人工智能(AGI)的重大问题带入公共辩论。本文分析这一举措背后的行业信号,以及从技术竞赛走向公共治理的转向意义。