[控场AI]
· 5 分钟阅读· 2,627 字

GPT-6 Astra发布:OpenAI首次承认达到AGI水平

GPT-6 Astra发布:OpenAI首次承认达到AGI水平

OpenAI发布GPT-6 Astra,首次宣称达AGI水平,ARC-AGI测试近乎满分,但距超级智能仍有两块关键拼图。

OpenAI发布新一代模型GPT-6 Astra,据B站UP主阿猪解读,这是一次全新预训练换代,也是OpenAI首次公开宣称模型达到AGI水平。Astra在ARC-AGI测试中从上一代的7.8分飙升至99.9分,并在编程、数学、科研等多项基准上全面刷新纪录。实战层面,Astra能视觉操控电脑完成金融建模(速度是人类冠军的4倍),并可连续自主开发一周构建完整3D城市场景。办公场景中,PPT制作、Excel还原、财税处理均可"一句话"完成。价格虽为上一代2.5倍,但因token效率提升,实际任务成本未必增加。短板方面,前端审美和3D构建不及Claude系模型,写作仍有AI味。距离ASI,还差模型自我改进与世界模型两块拼图,或留待GPT-7、GPT-8实现。

OpenAI正式发布了新一代模型GPT-6 Astra,据B站UP主阿猪的解读,这次OpenAI首次承认自家模型已经达到AGI(通用人工智能)水平。这不是GPT-5.5、5.6那样的小版本迭代,而是一次全新的预训练模型换代。本文梳理Astra的能力表现、真实测试案例,以及它与真正的超级智能之间还差多远。

跑分全面刷榜,ARC-AGI逼近满分

Astra在各类基准测试上呈现出对上一代的碾压。无论是编程、电脑操控,还是数学、科研领域,它都大幅超越了此前所有模型。

最具标志性的数字来自ARC-AGI测试——这是专门考验AI通用推理能力的高难度评测,满分为100分。上一代GPT-5.6仅拿到7.8分,而Astra直接冲到了99.9分。这个跨度不是渐进式提升,而是接近“解题范式”层面的突破。

当然,跑分容易注水,真正能说明问题的是实战。原始解读中给出的几个案例,比空洞的榜单更有说服力。

ARC-AGI(Abstraction and Reasoning Corpus for Artificial General Intelligence)由AI研究员François Chollet于2019年提出,专门用于衡量模型的抽象推理与泛化能力。与传统基准测试不同,ARC-AGI的题目设计刻意避免了对记忆和训练数据的依赖——题目本身人类几乎都能答对,但对AI极具挑战性,因为每道题都要求从极少数样本中归纳出全新规律。正因如此,它长期被视为衡量模型是否具备"类人通用推理"的金标准,而非简单的知识问答能力测试。此前GPT-4等顶级模型在ARC-AGI上的得分长期徘徊在个位数至30分区间,Astra据称一举突破至99.9分,若属实则意味着该测试已基本失效为有效的区分性评估工具,这本身也是AI能力跃迁的一个侧面体现。

电脑操控与超长任务:接近科幻的实战表现

那我们来看几个它的实战能力

第一个案例是电脑操控。Astra在一项金融建模世界杯挑战中,全程通过视觉“看”屏幕、用鼠标键盘操作完成任务,速度达到了人类冠军的4倍。这意味着它不再依赖专门的API接口,而是像人一样直接操作图形界面。

第二个案例是持续运行能力。Astra连续开发一周,用虚幻引擎构建了整个曼哈顿,放大到每一条街道、每一家店铺都有细节。需要更精致时,它可以先在Blender中建模,再导入虚幻引擎,让用户在生成的环境中实景体验。这种近乎无限时长的自主开发能力,是过去模型难以企及的。

制作这种3D游戏

在3D游戏开发上,Astra同样游刃有余。解读中还提到一个有趣的小bug:连续按空格跳跃竟然能让角色飞起来——某种程度上也说明它生成的是真实可运行的项目,而非演示品。

办公场景:一句话搞定表格与财税

回到日常工作,Astra制作的PPT已被评价为达到非常专业的程度。它可以仅凭一张图,还原出高度可编辑的Excel表格;处理财务、税务表单,查询、预约等操作,如今都是“一句话的事”。

用原文的说法:它干得比你快,还比你好。对大量重复性办公任务而言,这类能力的实用价值可能比跑分更直接。

价格更贵,但实际花费未必更高

目前Astra的价格是上一代GPT 5.6的2.5倍

性能提升的代价是价格。目前Astra的单价是上一代GPT-5.6的2.5倍。

不过据解读,Astra的token效率更高,同样一个任务测试下来,实际花费的金额经常反而比5.6更少。也就是说,单价虽高,但完成任务所需的token更少,综合成本未必上涨。这一点在实际部署时值得留意——单看标价容易产生误判。

短板依然存在:审美、3D与写作

Astra并非全能。一位提前试用的用户评价指出,它的前端审美和3D构建能力依然不如Claude系的模型(原文称CloudFable 5.1),在写作风格的学习上也表现欠佳——说白了,写出来的东西还是有股“AI味”。

这提醒我们,即便自称AGI,模型在偏主观审美和风格模仿的领域仍有明显天花板。不同模型之间的能力分布,并没有因为一次换代而完全统一。

距离ASI还差两块拼图

也就是超越了AGI的超级人工智能

从更宏观的视角看,Astra距离ASI(超越AGI的超级人工智能)还差两块关键拼图。

第一块是模型级的自我改进——能通过持续学习实现自我进化,而非依赖人工重新训练。第二块是世界模型方向,也就是杨立昆(Yann LeCun)和李飞飞所研究的、对现实物理世界的感知与决策能力。这两项能力,或许要留给GPT-7和GPT-8去完成。

即便如此,Astra当下赋予个人的能力已经接近科幻。你甚至可以组建一支由几十个Astra Agent组成的团队,仅凭一人之力,去实现过去只有成百上千人公司才敢想的目标。这或许才是这次发布最值得思考的地方:能力的门槛正在被重新定义。

注:本文基于B站UP主阿猪的单一来源解读整理,部分技术数据与产品名称以原始视频表述为准,建议以OpenAI官方发布信息为准交叉核实。

AGI(Artificial General Intelligence,通用人工智能)与ASI(Artificial Super Intelligence,超级人工智能)是AI发展路线图上的两个重要里程碑。AGI通常被定义为能在所有认知任务上达到或超越人类水平的AI系统;而ASI则在此基础上进一步超越,指在几乎所有领域都远超人类最顶尖水平的智能体。杨立昆(Yann LeCun)作为深度学习三巨头之一、Meta首席AI科学家,长期主张当前的大语言模型路线无法通向真正的AGI,认为缺乏"世界模型"(World Model)是核心瓶颈——即AI需要像婴儿通过感知物理世界来建立直觉一样,对因果关系和物理规律形成内在表征,而非仅靠语言数据的统计拟合。李飞飞则通过"空间智能"(Spatial Intelligence)研究推动AI理解三维现实世界。这两个方向代表了从语言智能到具身智能的关键跨越。

分享:

相关推荐