GPT-5.6全面开放:Sol/Terra/Luna三档模型与四智能体并行深度解析

GPT-5.6正式开放:暂停之后的完整答卷
十几天前,OpenAI将旗下最强模型按下暂停键,先交由美国政府审阅、在小范围内测试。今天正式开门:GPT-5.6的三个型号 Sol、Terra、Luna 同时面向所有用户开放,ChatGPT、Codex 和 API 全线可用,并在24小时内完成全球铺开。
更值得关注的是,官方将此前压着未放的完整评测成绩单一并公布。需要说明的是,本文所有分数均来自 OpenAI 官方发布的评测结果,连同官方自己标注的注脚一起看,才算读完整。
命名规则的转变:从代次到能力档位
这次命名规则也变了。过去数字代表第几代,而现在 Sol、Terra、Luna 三个名字代表的是能力档位,各自可按自己的节奏迭代:
- Sol:旗舰最强型号;
- Terra:面向日常高频工作,性能追平上一代 5.5,但价格更低;
- Luna:主打快速与省钱,走性价比路线。
从代次编号转向能力档位命名,背后是一种更成熟的产品线管理思路。这一转变在半导体和消费电子行业已有成熟先例——英特尔的Core i系列、高通的骁龙8/7/6系列,以及苹果的M系列芯片(M4 Pro/Max/Ultra),都采用了类似的「旗舰-主流-入门」分层架构。这种命名体系的核心优势在于将「产品迭代」与「代际更替」解耦:旗舰档位可以快速响应技术突破,而主流档位则优先优化成本效益比,两者不再需要同步发布。
传统的版本号体系(如GPT-4、GPT-4.5)隐含着线性进化的假设,每一代都要全面超越上一代,这对研发节奏和市场预期都造成了压力。而Sol/Terra/Luna这种档位命名,允许不同档位按各自的迭代周期独立演进,也让用户能根据实际需求和预算做出更精准的选择,而非被迫追逐最新旗舰。对AI模型而言,这一转变尤为重要——不同规模的模型在训练、调优和部署上的周期差异显著,强行绑定在同一代次号下,要么拖累快的,要么催促慢的。这种命名逻辑的转变,也在暗示OpenAI对产品线的长期规划:不同能力层级的模型将长期共存,而非被单一旗舰替代。
这次发布的核心叙事只有一句话:让每一亿美元买到更强的性能。重点不再是刷榜第一,而是同样的任务,用更少的 Token、更短的时间、更低的成本完成。
评测成绩解读:不只是分数,而是效率曲线
智能体与编程能力
AI评测基准的历史本身就是一部能力认知的迭代史。早期的MMLU(大规模多任务语言理解)测试包含数学、历史、法律、医学等57个学科的选择题,要求模型从四个选项中选出正确答案,侧重静态知识的广度覆盖。HumanEval则要求模型根据函数签名和文档字符串生成能通过单元测试的Python代码,侧重单次代码生成的准确性。这两类基准测试的是模型「知道什么」,但随着顶尖模型在这些测试上逼近满分,它们的区分度迅速饱和,且与真实工作场景严重脱节——真实工作中几乎没有「一次性问答」,更多是多轮交互、工具调用和错误恢复。
正是在这一背景下,第三代评测范式应运而生。「智能体终极考试」(Agent Ultimate Exam)覆盖55个专业领域的长程工作流,是专为评估AI在真实任务中持续决策能力而设计的综合基准。与传统的单轮问答基准不同,它要求模型在多步骤任务中保持上下文连贯、正确使用工具调用并处理中间错误。Artificial Analysis编程智能体指数则由独立第三方机构运营,聚焦代码生成、调试和多轮交互的综合质量,相比HumanEval等较早期基准更贴近工程实际。两项基准共同指向同一个趋势:评测重心正从「一次答对率」转向「完成任务的全链路效率」,这一转变对模型开发方向有直接影响——训练目标从「答对」转向「用最少资源完成真实任务」,推动了强化学习和工具使用能力的大幅进步。
在上述「智能体终极考试」中,Sol 拿到53.6分,创下新高,比对标的 Fable 5 高出13.1分。即便推理档位调至中等,依然领先11.4分,而估算成本仅约1.4分。更有意思的是,较便宜的 Terra 和 Luna 同样超过了 Fable 5,成本约1.16分。
在 Artificial Analysis 编程智能体指数上,Sol 开到最高推理档拿下80分,创下新纪录,比 Fable 5 高2.8分。真正的亮点在后半句:它使用的输出 Token 不到一半,耗时不到一半,成本还低了约三分之一。同家族的 Terra 略高于 Fable 5,Luna 则超过了 Opus 4.8。
知识工作与桌面操作
BrowseComp是由OpenAI自研的网页浏览能力基准,核心挑战在于要求模型通过多轮真实网页交互检索并综合信息,而非依赖预训练记忆,因此能更有效地测量模型的实时信息处理能力。区别于传统RAG(检索增强生成)测试中提前准备好检索语料的做法,BrowseComp要求模型自主决定搜索策略、判断检索结果的可信度并跨页面整合信息,更接近真实的信息分析工作流。
OSWorld 2.0则是计算机操作基准,模拟用户在真实操作系统界面上执行跨应用任务(如在文件管理器中整理文件后粘贴到邮件中),涉及截图理解、GUI元素定位和多步骤执行。该基准对多模态能力的要求尤为苛刻:模型需要同时理解界面截图的视觉语义、推断当前任务进度,并决定下一步鼠标或键盘操作。这一能力链路的实现依赖多模态融合训练——模型不再将图像翻译成文字描述再推理,而是让视觉编码器与语言解码器共享同一套表征空间,在统一的特征空间中直接进行跨模态关联,使界面元素的空间关系和语义含义可以被同时理解。这是OSWorld类任务所需「看懂就行动」能力的技术基础,也是近两年多模态融合训练最直接的产物。
在网页浏览基准 BrowseComp 上,Sol 拿到92.2%;在模拟电脑操作的 OSWorld 2.0 上拿到62.6%,两项均为当前最佳成绩。尤其在 OSWorld 上,超过 Opus 4.8 的同时,输出 Token 减少了85%。这一数字尤其值得关注——它意味着模型学会了更直接地「看懂界面并行动」,而非用大量语言推理来弥补视觉感知的不足,反映出多模态理解与行动规划能力的实质性跃升。

这些数字讲的从来不只是分数,而是同样的结果、更少的 Token、更短的时间、更低的成本。这条效率曲线,比排行榜第一更值得持续关注。
Ultra 模式揭秘:默认四个智能体并行
此前不少人将 Ultra 当作「玄学」,这次官方终于说清楚了。模型会比以往花更多时间推理、识别路径、自查与修正;而 Ultra 更进一步——它默认同时协调四个智能体并行工作,用更多 Token 换取更强的结果和更短的完成时间。
Ultra模式协调四个智能体并行工作,在学术上对应的是「集成推理」(Ensemble Inference)和「多路径探索」(Multi-path Search)的结合。单一模型的链式思维(Chain-of-Thought)推理存在路径依赖问题:一旦早期步骤走偏,后续推理很难自我纠正——这一现象在数学解题中尤为明显,错误的中间变量会被后续步骤不加质疑地继承。而多智能体并行架构允许同时探索多条解题路径,最终通过投票、评分或另一个模型的判断来选择最优结果。
这本质上是将「推理宽度」从串行扩展为并行,以更高的算力换取更低的错误率和更短的挂钟时间。不同智能体可以同时探索不同的解题路径,或分别负责计划、执行、验证和修正等不同角色——这种角色分工对应的是软件工程中的「职责分离原则」(Separation of Concerns),在AI系统中体现为将元认知(我该怎么做)与执行(具体操作)分配给不同的专用模块,避免单一模型在两种认知负荷之间频繁切换。DeepMind的AlphaCode 2和Meta的多智能体代码生成研究都验证了这一路径的有效性:与其让单个模型做更长的链式推理,不如用并行化分摊认知负担、缩短挂钟时间。代价是Token消耗成倍增加,其工程挑战在于:如何设计任务分解粒度使并行收益最大化,以及如何在结果汇总阶段避免「最坏答案污染最好答案」的问题。
官方图表显示,引入并行智能体后,分数与延迟的前沿向左上方移动,即分数更高、时间更短。开发者若想自行搭建这种体验,可使用 Responses API 中仍在测试阶段的多智能体能力——需要自行设计任务分解策略和结果聚合逻辑,这也是当前AI工程落地的核心难题之一。OpenAI将此能力作为产品默认选项而非实验特性,标志着「多智能体协作」从研究原型走向工程标配,正将多智能体协作从概念落地为产品默认能力。
网络安全:提升最显著,也最需审慎看待
网络安全是本次提升幅度最大的方向,也是最需要谨慎表述的部分。
- ExploitBench 二代:73.5%,上一代仅47.9%;
- ExploitGym(两小时限制):峰值通过率从15.1%提升至24.9%,近乎翻倍;放宽至6小时可达33.7%;
- CyberSecBench Pro:71.2%,上一代45.8%。

ExploitBench和ExploitGym是专门针对漏洞利用能力设计的安全基准,前者测试模型能否在受控环境中找到并利用真实CVE(通用漏洞披露)漏洞,后者则引入时间限制模拟真实渗透测试场景——两小时限制对应的是高强度CTF(夺旗赛)竞赛中单题的典型时间窗口。CVE体系由MITRE公司维护,是全球网络安全漏洞的统一命名标准;能够在受控环境中复现CVE漏洞利用路径,意味着模型掌握了从漏洞原理到攻击实施的完整推理链,这一能力对防守方(漏洞修复、影响评估)和攻击方(实际利用)均具有重要价值,这也正是此类评测需要特别注意语境的根本原因。这里必须补充官方自己标注的注脚:这些网络安全评测是在降低防护的条件下运行的——这意味着正常产品状态下的模型能力会被安全层主动压制,评测分数反映的是模型的能力上限而非日常可用水平。
「能力与防护解耦测试」揭示了AI安全研究中的一个根本性张力:要准确评估模型的真实能力上限,就必须暂时移除防护层;但移除防护层的测试结果一旦公开,本身就可能成为攻击者的参考基准,帮助其判断哪些攻击路径值得投入。这种两难在核武器、生物技术等高风险领域同样存在,通常的解决方案是「受限披露」——将详细方法学只向特定安全研究人员公开。OpenAI选择在官方报告中明确标注「降低防护条件下测试」的注脚,是一种折中的透明度实践:公开足够信息以供学界审视,同时通过注脚引导读者正确理解数字含义。然而,注脚在大规模传播中极易被忽略,这也正是「连同官方注脚一起看才算读完整」这句话的核心价值所在。同样,官网给出的成本与延迟均为模拟估算,并非真实账单,实际差异可能较大。此外,生物学基准 GenieBench 评测未将对比模型纳入,因此不能简单描述为「全面领先」。
能力提升的代价
OpenAI 这次给出了量化答案。新模型拦截的潜在有害活动,达到此前模型的 10倍。正式开放前,他们投入约70万 A100 等效 GPU 小时进行黑盒自动化红队测试,专门寻找可跨场景通用的越狱方式。防护机制也不再只依赖分类器打标签,而是引入了一个具备推理能力的监控器,读取完整对话再判断是否存在风险。
传统内容安全机制依赖分类器:将输入文本映射到预定义的有害类别,速度快但规则固定,容易被精心构造的措辞绕过——例如用「假设性场景」或「学术讨论」包装真实意图。新引入的推理监控器本质上是一个独立的语言模型,它读取完整对话上下文后进行语义级别的风险判断,能够理解多轮对话中的隐含意图和跨句关联。这种方式更接近人类审核员的工作方式,对复杂越狱攻击(如角色扮演包装、分步诱导、虚构框架嵌套)具有更强的识别能力。
从架构层面看,推理监控器相当于在主模型的输出管道上增加了一个「元认知层」:主模型负责生成内容,监控器负责审查内容是否符合安全策略。这种「生成-审查」双层架构与宪法AI(Constitutional AI)的思路有所呼应——后者由Anthropic提出,通过让模型依据一套预设原则自我批判和修正输出来提升安全性。两者的核心区别在于:推理监控器是独立运行的外部审查者,而宪法AI是模型自身的内化约束。这种结构差异赋予了推理监控器一个重要优势:它天然免疫「自我欺骗」型越狱攻击——即攻击者诱导主模型相信有害输出符合安全原则的那类操控。代价是计算成本更高——每次响应都需要额外运行一个完整的推理步骤,且存在误判敏感但合法内容的风险,例如将安全研究人员的漏洞分析报告识别为攻击指令。正是这种误判风险,直接导致了下文所述的「误伤」问题和模型切换选项的设计。
代价是「误伤」。因此在 ChatGPT 和 Codex 中保留了一个选项,允许切换到能力稍低的模型重新运行。

最值得记住的是官方那句话:过度封锁本身就是一种安全风险。它拦截的是防守方,让人无法测试系统、无法发布补丁;而恶意行为者依然可以使用其他模型,包括越来越强的开源模型。
想要获取更高防御能力的用户,可申请名为 Trusted Access 的计划,用于漏洞分诊、恶意软件分析、补丁验证等正当工作。Trusted Access计划引入硬件安全密钥,标志着高能力AI工具的访问控制正在借鉴金融级安全架构。FIDO2/WebAuthn标准下的硬件密钥(如YubiKey、Google Titan Key)提供的是「不可克隆的物理存在证明」:私钥永远不离开硬件设备,即使用户的计算机被完全入侵,攻击者也无法在没有物理设备的情况下冒充用户。这与传统的「知识因素」认证(密码)和「持有因素」认证(手机短信验证码)形成了层级递进,在安全性上实现了质的跃升。
对AI安全治理而言,这种设计背后的逻辑是将能力访问权限与可追溯的真实身份绑定,从而在出现滥用时能够归因和追责。这种分层授权架构在金融和医疗领域已有成熟实践,OpenAI将其引入AI访问控制,预示着未来高风险AI能力的商业模式可能进一步演化:从「付费即用」转向「付费+实名+可信设备+使用审计」的多重门槛体系,类似于当前金融衍生品交易或危险化学品购买的合规要求。但有一个门槛:个人成员需在9月1日前开启带硬件密钥的高级账号,否则将退回默认权限。
谁能使用,价格几何
在 ChatGPT 中,Plus、Pro、商业版和企业版用户可使用 Sol 及更高质量版本;免费和普通用户可使用 Terra;付费用户可在三个型号中自由选择,并自行设定推理档位。Max 对所有能使用 GPT-5.6 的用户开放,在设置中开启即可;Ultra 则限制在更高订阅档位。
API 定价按每100万 Token 计算:
- Sol:输入5美元 / 输出30美元;
- Terra:输入2.5美元 / 输出15美元;
- Luna:输入1美元 / 输出6美元(最低价)。

缓存机制这次也更加可预期:支持显式缓存断点,最短保留30分钟;写入缓存按未缓存输入价格的1.25倍计费,读取缓存仍享受一折优惠。
理解显式缓存断点的价值,需要先了解Transformer架构中KV缓存的工作原理:每次前向传播时,注意力层需要为序列中每个位置计算Query、Key、Value三组向量,其中Key和Value的计算结果与输入内容直接对应,对于在多轮对话中保持不变的系统提示和历史内容,这部分KV状态完全可以复用。这一原理类似于CPU的L1/L2缓存——将高频访问的数据保留在快速存储中,避免每次都从头计算,读取成本因此可降至原价的10%。
显式缓存断点(而非系统自动决定缓存边界)赋予了开发者更精细的控制权:可以将不变的业务规则与频繁更新的用户上下文分别设置不同的缓存边界,针对具体业务场景最大化缓存命中率。对于系统提示超过数千Token的企业应用,这一机制可将实际账单压缩40%至70%,是高频调用场景下不可忽视的成本优化手段。写入缓存按1.25倍计费是合理的成本分摊——首次建立缓存需要额外的存储和管理开销,类似于数据库索引的构建成本;而后续每次读取享受的九折优惠,则在调用量足够大时迅速抹平这一初始溢价。
读懂这次发布的三条主线
这次发布真正传递的信息不是「又一个第一名」,而是三条主线:
第一,所有分数均来自 OpenAI 官方评测,连同官方注脚一起看才算完整;
第二,值得反复审视的是那条性能与成本的效率曲线——同样的任务,更少的 Token、更短的时间、更低的花费;
第三,能力越强,开放的代价越大——拦截量翻10倍,按身份分层授权、用硬件密钥换取更高权限。
你已经开始使用 GPT-5.6 了吗?效果如何?欢迎在评论区分享你的使用体验。
核心要点
相关推荐

OpenAI Dev Day 全盘点:20+ 发布背后的三大趋势
OpenAI Dev Day 一次性发布 20+ 产品,涵盖个人智能体 DOTS、GPT-6.1 Sol、Decisions API、Space 协作区与模型市场。本文全面盘点并解读其揭示的三大 AI 趋势。

只想要一个自定义域名邮箱,为何如此艰难?
拥有一个自定义域名邮箱看似简单,实则涉及 SPF/DKIM/DMARC 配置、IP 信誉、托管服务成本等诸多难题。本文梳理自建与托管方案的权衡,并给出实用建议。

Claude意外帮用户发现燃气泄漏:AI助手的安全应用边界
一位Reddit用户借助AI助手Claude识别出家中燃气泄漏隐患,PG&E上门确认并修复。本文分析AI助手在家庭安全场景中的真实价值与使用边界,以及处理燃气泄漏的正确做法。