GPT-6 Astra做游戏实测,AI机器人已在酒吧上班

本周AI领域再次迎来密集更新:OpenAI推出GPT-6 Astra并展示其做游戏的能力,Claude、Gemini、通义千问等模型集体升级,而更值得关注的是——AI不再只停留在演示屏幕里,它已经走进香港兰桂坊的酒吧,开始真正"上班"了。
GPT-6 Astra:从写代码到看屏幕做游戏
本周最受瞩目的发布无疑是OpenAI的GPT-6 Astra。与以往厂商急于亮出跑分不同,这次官方选择用一个更直观的场景来展示能力——做游戏。
在演示中,Astra制作的卡丁车可以直接开,三维场景能进去逛。更关键的是,它不仅仅是"写出代码",而是能够操作建模软件和游戏引擎,把一个想法变成看得见、玩得到的场景。这背后是一种能力范式的转变:模型可以看屏幕、点击界面、检查自己的作品,再继续修改。这已经从"生成"迈向了"操作与自我校验"。
这种能力在技术上属于**代理(Agent)**范式——模型的输入不再只是用户的提问,还包括实时截图、界面状态和程序反馈,形成感知-行动的闭环。它依赖视觉语言模型(VLM)与工具调用(Tool Use / Function Calling)的结合,叠加强化学习机制让模型学会何时确认、何时继续。游戏开发恰好是验证这一能力的绝佳场景,因为它同时需要创意生成、代码执行、可视化反馈和多轮修订,覆盖了代理模型几乎所有的核心能力维度。

值得冷静看待的是,OpenAI公开的这些都是官方精心挑选的演示,不等于随便说一句话就能产出商业大作。不过游戏公司Plico展示的实战案例更有说服力:将Astra接入开发工具后,可以修改场景、运行试玩,同一个基础关卡还能变出不同主题的游戏原型,团队称需要人工修补的问题减少了一半。
这个数字或许是本次发布最实在的信号。它不是人人立刻可得的效果,但从"想到一个点子"到"做出能玩的原型",门槛确实在往下走。除了做游戏,Astra还能处理表格、文档和多步骤电脑任务。目前采用分批开放策略,具体权限以账户为准。
Claude与Gemini升级:AI正在把说明书变成工具
Anthropic的Claude也迎来升级,Fable 5.1和MyFast 5.1同时登场。官方给出了一个非常有想象力的例子:利用30多年前的雷达数据帮助重建金星地形,覆盖了约三分之一颗星球,过去看不清的火山如今能分辨出更多细节。
这些数据来自1990年代初NASA麦哲伦号探测器采集的合成孔径雷达(SAR)原始回波,长期以来因处理算法的限制只能生成分辨率有限的地形图。Claude在这里的价值并非直接"看懂"雷达信号,而是通过辅助编写数据处理管线、优化插值算法、自动化比对校验步骤等方式,大幅压缩了研究人员在重复性计算任务上花费的时间。这是AI在科学领域价值的典型模式:不替代科学家的判断,而是让科学家能把精力集中在假设构建和结果解读上。

这个案例的意义在于——老数据并没有过时,只是终于等到了能充分挖掘它的"新同事"。Fable面向常规用户,而MyFast的部分能力仍处于限制开放状态。
谷歌方面则更新了Gemini 3.8,展示了能拖动拆解的三维硬件模型,甚至把谷歌地图变成了复古电脑界面,路线和街景都能交互使用。这类演示比一张排行榜更容易让人理解AI的价值:它正在把静态的说明书,变成可以动手探索的小工具。
不过这里有个隐藏成本需要注意:当前主流大模型按Token计费,而随着模型能力增强,用户自然倾向于提交更复杂的任务——长文档分析、多轮代理工作流、代码生成加调试——这些任务的Token消耗量往往是简单问答的10至100倍。此外,"深度思考"模式会在返回答案前生成大量中间推理Token,通常计入账单但用户不可见。单价没涨,不代表最终账单不会涨——评估AI工具的真实成本,应追踪"任务完成成本"而非"单次请求价格",这是所有依赖大模型的用户都需要警惕的现实问题。
AI机器人上班:从展台走向真实服务场景
如果说模型升级还停留在软件层面,那么本周最有"烟火气"的进展,是AI机器人真正走进了服务业。
置评方的爱宝机器人进驻香港兰桂坊酒吧,为顾客调制鸡尾酒并进行互动。这一步的难度远超展台演示:嘈杂的音乐、来回走动的人群、不断变化的灯光,才是服务机器人真正的考题。业界通常用"非结构化环境鲁棒性"来衡量机器人的真实能力水平——真实酒吧中强光与阴影交替、背景噪声可达85分贝以上、人群随机移动,这些都会大幅降低机器人视觉感知和语音识别的准确率。调酒本身也涉及对不规则容器的抓取、液体的精准控制以及对模糊语义指令的理解,每一项都是机器人学领域的开放难题。兰桂坊这次部署的意义在于:它提供了真实的压力测试数据,这比任何实验室报告都更能说明机器人的实际可用程度。

当然,现在还不到宣布"人类酒保失业"的时候。机器人能否持续稳定地提供服务,还得看长期表现。用一句话概括就是:人类负责微醺,机器人负责清醒上班。
消防领域也有类似进展——机器狗搭载消防设备,参与侦查和灭火演示,展示了AI在高危场景中替代人力的潜力。

天气预测与自动驾驶:AI关心你出门带不带伞
谷歌还发布了WeatherNext 3,这个更新颇为务实。它直接利用卫星观测,每小时更新一次全球预测,覆盖温度、湿度等数据,空间分辨率达到5公里,并将应用于谷歌搜索、地图等产品。
WeatherNext 3代表的是AI气象预测与传统数值天气预报(NWP)之间竞争格局的最新进展。传统NWP基于流体动力学方程组,用超级计算机对大气进行网格化数值积分,计算成本极高、更新频率受限。而AI气象模型通过在ERA5等历史再分析数据集上训练,学会了大气系统的统计规律,可以在分钟级别内完成全球预报。WeatherNext 3的关键进步在于直接融合实时卫星观测,而非依赖已处理过的分析场数据,使其能更快捕捉快速发展的天气系统(如对流风暴)。5公里的空间分辨率也优于大多数全球NWP产品(通常为9–25公里),对城市级精细化预报有实际意义。
它的目标不是保证每场雨都算准,而是更及时地跟上天气变化。在满屏"AI焦虑"的当下,终于有一项技术在认真关心一件小事——你出门到底该不该带伞。
在出行领域,Waymo与Uber在伦敦上线了自动驾驶载客服务,但需要注意的是,现阶段车内仍配有安全员,属于渐进式落地。这是业内通行的"渐进式商业化"路径——安全员在场阶段的核心目标并非盈利,而是在新城市的真实流量中积累长尾场景数据。伦敦道路有几个独特挑战:靠左行驶、密集的环形交叉路口、历史街区中不规则的路网以及高密度的自行车流,这些都要求自动驾驶系统针对性地补充训练数据和调整决策策略。有安全员在场是监管框架要求的合规步骤,也是向公众和保险机构建立信任的必要过渡。
其他值得关注的AI动态
本周还有多条快速更新:
- 通义千问3.8 Max推出更新版,重点增强编程和协同办公能力,但这次并未开放模型权重;
- Meta发布Muse Spark 1.3,展示了更强的编程和工具使用能力,最高推理模式也已开放;
- World Labs公布Atlas世界模型,可用少量照片构建连贯的三维场景,目前属于早期演示;
- TCL的AI陪伴机器人AIM亮相柏林IFA展,主打家庭互动——可爱是真的,但带娃还得靠自己。
结语:创作门槛在降,落地成本在变
纵观本周的进展,可以看到两条清晰的主线。一是创作门槛的持续下降:从Astra做游戏到Gemini把说明书变工具,AI正让"从想法到成品"的距离越来越短。二是AI从演示走向真实场景:无论是酒吧调酒机器人还是自动驾驶载客,技术正在直面真实世界的复杂性考验。
但热闹之下仍需保持清醒:官方演示不等于人人可得的能力,单价不涨也不代表账单不涨,机器人进驻不等于人类立刻被替代。AI焦虑之外,我们更需要的是对每一项进展理性的分寸感。
核心要点
相关推荐

短视频创作者如何使用AI视频生成工具
探讨AI视频生成工具在短视频创作中的实际应用现状。从Seedance到Runway,创作者如何将AI素材融入作品?揭示演示效果与实战应用的差距,以及AI工具在创作流程中的真实定位。

家庭数据中心搭建指南:私有云自托管完整实践
深度解析家庭数据中心搭建全流程,涵盖硬件选型、软件架构、成本分析与运维挑战。从数据主权到技术实践,助你构建个人私有云基础设施,掌控数字资产自主权。

Engrim:AI命令行工具的本地记忆引擎解决方案
Engrim 是一个开源的本地优先 SQLite 记忆引擎,专为 Claude Code、Aider 等 AI 命令行工具打造,解决上下文丢失问题,保护数据隐私,实现跨工具记忆共享。