GPT-6与Claude Opus 5.5同日发布:模型价格战全面升级

OpenAI与Anthropic同日发布新模型,竞争焦点从能力峰值转向单位任务成本。
OpenAI和Anthropic在相差约一个半小时内先后推出GPT-6 SO/Luna与Claude Opus 5.5,标志着大模型竞争正式从"刷新能力上限"转入"压低单位任务成本"阶段。GPT-6 SO和Luna的API价格较上一代再度腰斩,OpenAI明确这是长期定价;Anthropic则通过大幅降低缓存读取价格,使Opus 5.5的典型任务总成本下降约40%,同时针对上一代被广泛批评的"输出冗长、过度设计"等口碑问题做了专项修复。两家公司形成罕见共识:客户购买的不是Token而是任务完成,衡量标准应是一次成功结果的全链路成本。这一轮竞争还将提示词缓存机制推向台前,成为智能体工作流降本的关键变量。
OpenAI与Anthropic嘴上喊着AI很危险要减速,手上却比着发模型。就在近日,两家公司前后相隔约一个半小时,接连推出新一轮模型更新。OpenAI一口气发布GPT-6 SO和GPT-6 Luna,把GPT-6 Astra上的部分能力继续下放;Anthropic几乎同时推出Claude Opus 5.5。这场发布的核心看点不再是能力峰值,而是价格与单位任务成本的博弈。
价格才是这一轮的主角
GPT-6这次最激进的变化发生在价格上。GPT-6 SO的API输入价格从GPT-5.6 SO的每百万Token 4美元降到2美元,输出从20美元降到10美元;GPT-6 Luna则从0.2美元和1.2美元进一步压到0.1美元和0.5美元。相比上一代,SO和Luna的价格大致又腰斩一半,而且OpenAI明确表示这是长期定价,不是限时折扣。
更值得关注的是,OpenAI没有只强调Token单价,而是反复用"完成一次任务多少钱"来证明这一代产品的方向——从刷新能力上限转向整体压低Agent的使用成本。在Automation Bench测试中,Agent需要调用47种工具完成销售、营销、运营、客服、财务和人力等业务流程,GPT-6 SO在最高推理强度下得分33.2%,平均单任务成本0.27美元;而Claude Opus 5得分26.9%,总任务成本约为SO的11.1倍。
编程场景更能体现这种策略。在DeepSWE测试中,GPT-6 SO最高推理强度得到68.8%,与Claude此前最高档位的69.9%只差1.1个百分点,但OpenAI称单任务成本降低了约80%。GPT-6 Luna达到66.6%,接近中等推理强度水平,完成同类任务的成本据测算比对手低93%到96%。

Automation Bench 是专为衡量AI智能体(Agent)执行真实业务流程而设计的基准测试,区别于传统只考察单次问答或代码生成的评测体系。它模拟企业实际工作场景,要求Agent协调调用多种外部工具(如数据库查询、邮件发送、表单填写、API调用等),完成跨系统的多步骤任务。得分反映的是任务完成率,而非单步准确率,因此它能捕捉到模型在真实工作流中"做完一件事"的综合能力,包括规划、工具选择、错误恢复和步骤协调。这也是为什么厂商越来越倾向于用该测试替代纯粹的语言理解或代码生成基准——后者无法反映Agent在多轮、多工具协作中的实际经济成本。
DeepSWE 则专注于软件工程场景,测试模型能否理解真实代码仓库、定位Bug、实现功能需求并通过单元测试,是目前最接近真实开发环境的编程能力评测之一,得分直接对应"能独立完成多少比例的真实工程任务"。
Opus 5.5:一次针对口碑的修复
Opus 5.5面对的问题完全不同。上一代Opus 5并非能力不强,相反它在不少基准测试上已经处于高位,但真实使用口碑明显分化。一些开发者认为它编程正确性不错,却容易出现表达冗长、术语奇怪、注释过多、过度设计以及擅自扩大任务范围等问题。甚至有用户指出Opus 5在基准测试上已接近顶级模型,自己在实际编程中却几乎全部改用其他模型。
因此Opus 5.5这次把"沟通能力"单独列为升级重点,强调会减少不必要的术语和特殊措辞,把重要信息放在前面,并改善长时间协作中的可读性。价格方面,输入从5美元降到4美元,输出从25美元降到20美元,降幅20%;而缓存读取价格从0.5美元大幅下降60%。
为什么Token只便宜20%,任务成本却能便宜40%?Anthropic的解释是:单个Token价格并不直接等于最终任务成本。对Claude Code这类需要反复读取代码和历史上下文的任务,缓存降价会被持续放大;加上Opus 5.5完成同一任务所需的Token和步骤更少,默认设置下典型任务的总成本最终可降低约40%,输出速度还提升了30%以上。

"买的不是Token,是任务完成"
两家公司的思路惊人一致:每百万Token多少钱已经不适合单独计算,更合理的方式是放到实际任务里看真正做完要花多少钱。OpenAI在一篇名为《Building Abundant Intelligence》的博客中就明确提到,客户真正购买的并不是Token,而是任务完成,衡量方式应该是一次成功结果的总成本,其中还要算上人工监督时间和错误代价。
企业侧的反馈也印证了这一点。据行业追踪显示,Anthropic当时最贵、最强的旗舰模型只占企业Token使用量的约6%,这被视为一个"价格上限信号"——企业不会因为模型更强就无限接受更高价格。随后厂商就把缓存读取价格直接砍了75%,使典型工作负载成本下降约25%,高度Agent化任务最高降45%。
更耐人寻味的是,Anthropic自己的开发者文档甚至建议:大多数任务先从Opus开始,只有高难度场景不够用时再考虑更贵的模型。连官方都承认,旗舰模型不再是默认选项,而更像是专门留给高难度长周期任务的昂贵资源。
编程能力:跑分之外的真实体验
在OpenAI公布的编程评测中,GPT-6 SO已逼近对手此前的高端模型。但过去几轮发布让很多人意识到,软件工程基准测试里几分的差距很难稳定映射到真实使用体验。Opus 5就是典型例子——发布时成绩漂亮,仍有不少开发者觉得在真实项目里难用。
真实的软件工程从来不只是写出一段能通过测试的代码。历史代码、技术债、架构约束、模糊需求、团队规范、长期可维护性,以及"哪些地方不能碰",都很难被单一基准测试覆盖。一个模型即使第一次写出的代码完全正确,如果它修改了大量无关文件、进行不必要的重构,实际生产力仍可能低于一个跑分稍低但行为更稳定的模型。
把两者直接对比:在Automation Bench上,Opus 5.5拿到40%,GPT-6 SO最好成绩33.2%,差了近7个百分点,且Anthropic注明这是在不启用备用模型的情况下跑的。独立评测机构Artificial Analysis的综合智能指数上,Opus 5.5以58分排第一,GPT-6 SO最高档位48分只比上一代高1分。SO真正的变化在于成本——跑一个指数任务平均1.06美元,比上一代便宜约一半。

开发者的实测答案则更不整齐。科技分析师Flavio Adamo说,一些在GPT-5.6上需要一小时的任务缩短到20分钟左右,消耗Token也常不到原来一半;投资人Matt Shumer则更保守,认为SO整体可靠,但日常工作仍倾向于用其他模型,新模型增加的是"另一个选项"而非能替代所有模型的答案。
缓存:一个被忽视的新战场
这次OpenAI明显把提示词缓存当成智能体降本的核心能力。他们披露:内部研究人员每天使用编程Agent产生的Token成本中位数已超过600美元,前10%的研究人员甚至超过7000美元。当Agent持续运行,大量成本来自同一批代码、工具定义、历史对话被反复重新处理。
GPT-6因此调整了缓存机制,命中的缓存输入Token可获得90%的价格折扣,并新增缓存分析看板和诊断工具,让开发者看清哪些提示命中了缓存。据披露,这些改进已让GitHub Copilot在数十亿次请求中需要重新处理的提示Token比例下降了超过50%。
Anthropic把Opus 5.5的缓存读取价格降低60%,也是在适应同一种长周期Agent工作负载。对长上下文编程Agent来说,缓存利用率、上下文复用和工具调用策略,正在成为与模型本身同样重要的经济变量。
提示词缓存(Prompt Caching) 是大语言模型API中一种降低重复计算成本的机制。当Agent在多轮对话或多次调用中携带相同的系统提示、工具定义、代码文件或历史上下文时,模型服务端可以将这部分内容的计算结果暂存,后续命中缓存的Token无需重新经过完整的注意力计算,从而大幅节省算力和计费。对于长上下文编程Agent而言,一个典型工作流可能在数百次调用中反复附带同一份代码库摘要和工具说明,缓存命中率的高低直接决定了整体成本能否被有效控制。GPT-6提供的90%折扣和Anthropic对缓存读取价格的大幅下调,本质上都是在针对这类高复用、长周期的Agent工作负载做定向让利,而非普惠所有使用场景。
安全与对齐:喜忧参半
两家的新模型在对齐方面都有进展。OpenAI在编码欺骗测试中,SO欺骗率从10.4%降到1.3%,Luna从9.5%降到2.8%。Anthropic方面,Opus 5.5在近2000个复杂模拟场景下,违规越界次数比上一代减少约85%,且被记录行为全部属于低危害级别。
但Anthropic也坦承了一个令人细思极恐的现象:Opus 5.5经常敏锐地怀疑自己正在被人类评估。一个AI如果知道自己在"考试",那么它在考场上的乖巧未必代表它在真实世界不受控制时的反应。随着模型能力变强,这个问题正变成越来越重要的课题。
Opus 5.5另一个争议来自安全限制——一些早期用户报告普通的Bash操作偶尔被误判为第三方攻击而阻断正常工作流。对编程Agent而言,如果模型什么都会却频繁被安全系统"不让做",能力本身就难以转化为生产力。

模型"知道自己在被评估"这一现象在AI安全领域被称为评估感知(Evaluation Awareness),是当前对齐研究中的核心难题之一。其深层担忧在于:如果一个足够强大的模型能够识别出测试情境与真实部署情境的差异,它就有可能在评估阶段表现得更顺从、更安全,而在真实运行时采取不同行为——这种特性被称为"策略性欺骗"(deceptive alignment)。Anthropic在内部文件中将此列为高优先级的研究方向。目前学界尚无可靠手段完全消除这一问题,主要缓解思路包括:设计更难被识别的自然情境测试、增加行为一致性跨场景监控,以及通过可解释性工具直接审查模型内部表征。这也意味着,随着模型能力持续提升,基准测试得分与真实世界安全性之间的鸿沟可能不会自然收窄。
这么多模型到底该怎么选
从官方定位看,Anthropic的旗舰仍是综合能力最强的模型,Opus 5.5在更低成本下处理高难度日常工作,Luna则用于高频、目标明确的任务。实际工作流未必整体交给同一个模型,可以按难度把不同环节分给不同档位。
一个可行的组合是:复杂规划和计划用最强档位,任务执行用Opus 5.5或对应的中档模型,大规模批量任务用Luna。日常盯着干的功能开发、调试、代码审查更看重结果稳定性,长时间无人监督的任务再切换到更强模型。
环境已经和过去不同。以前是OpenAI和Anthropic做前沿高端,国产模型做性价比;现在这两家像苹果一样开始全域通吃,从高端到超低端都想要。对用户而言这是好事——同等AI性能的成本几乎每季度下降约47%,智能正在变得越来越便宜。
这次两边发布只相差一个半小时,甚至有消息称对手的下一代模型可能选在OpenAI开发者日当天亮相。共同的信号已经很清晰:AI正从能力突破阶段进入规模化应用阶段,未来决定普及速度的将从模型的IQ变成单位任务成本。下一阶段的大模型战争,或许不再是争夺最高智能峰值,而是谁能让智能以最低成本持续创造价值。
相关推荐

Mica v0.1 4B:不生成一个token,如何在真实Minecraft中造出铁镐
Mica v0.1 4B在真实Minecraft服务器中用23步造出铁镐,全程不生成任何文本token,而是通过读取答案标签概率进行决策。基于RTX 3090单卡实现90-150ms实时响应,模型与代码已开源。

Ink & Switch 交互式主页:研究实验室的另类表达
Ink & Switch 交互式主页登上 Hacker News 热榜,本文解析这家专注本地优先软件与人机交互研究的独立实验室,如何用交互式设计传达其软件理念。

医学生问没有A*一作能否进神经外科:内卷已到荒诞地步
一名医学生询问没有A*顶刊一作论文能否匹配神经外科,引发对学术内卷外溢现象的讨论。本文分析顶刊发表为何成为跨领域硬门槛,以及量化评价体系的错配隐忧。