[控场AI]
· 6 分钟阅读· 3,110 字

Anthropic与OpenAI同日降价:AI主战场从性能转向成本

Anthropic与OpenAI同日降价:AI主战场从性能转向成本

Anthropic与OpenAI同日相隔101分钟发布降价版模型,AI竞争重心从性能转向单位任务成本。

Anthropic与OpenAI在同一天相隔约101分钟先后推出降价版模型,而非更强版本,这一反常巧合标志着AI行业竞争逻辑的深层转向——从比拼能力转向争夺成本优势。两家宣传的降幅均存在口径问题:Anthropic以不同默认档位对比,OpenAI以促销价为基准,且双方对比表均刻意回避对方当日新模型。独立评测显示新模型存在性能倒退,本质是用少量分数换取大幅降价。下游案例更为直白:法律AI公司Harvey因席位定价与Token计费的结构性错位,毛利率一度由正转负,最终通过基于Kimi K3的自研模型、后训练优化、请求路由和产能条款组合实现成本回控。这条链路表明,AI应用层的关键竞争指标正从"能力分数"切换为"每完成一个任务的成本"。

两家最顶尖的AI公司在同一天、相隔约101分钟先后发布新模型,但这次发布的都不是更强的版本,而是降价版。这个反常的时间巧合,暴露出行业竞争逻辑的深层转向——从比拼谁更强,切换到同样的活谁更便宜。

同一天,101分钟:一场心照不宣的价格战

Anthropic率先推出 Opus 5.5,约1小时41分钟后,OpenAI一口气发了两款模型——GPT-6 的 Sol 和 Luna。据B站相关分析,两家此前从未在同一天、相隔如此之近地发布模型,这种巧合本身就值得玩味。

先看核心的价格数字。以每百万 Token 计:

  • Opus 5.5:输入 4 美元、输出 20 美元,比上一代挂牌价降了两成;缓存读取降幅更狠,直接砍了六成。
  • OpenAI Sol:输入 2 美元、输出 10 美元。
  • OpenAI Luna:输入 0.1 美元、输出 0.5 美元。

作为对照,两家旗舰级模型普遍是输入 10 美元、输出 50 美元的水平——这意味着 Luna 的定价仅相当于旗舰的 1%。价格下探的幅度相当激进。

降价口径的猫腻:数字要留个心眼

官方宣传的降幅并不能照单全收。Anthropic 宣称的"降四成",是拿默认设置来比的:新模型默认中档,而上一代默认高档。厂商自己也承认,在相同档位下,新模型每轮思考得更多,实际消耗未必更省。

OpenAI 这边同样有讲究——官方说的"降五成",基准是上一代的促销价,而非标准价。两个口径叠加,看对比表时必须格外留意。

这两个口径,看表的时候得留个心

更微妙的是,两家的对比表里都没放对方当天发布的新模型:OpenAI 对标的是老款 Opus 5,Anthropic 对标的是 GPT 5.6。谁真的更便宜,目前没有同口径的答案。

用分数换成本:这不是一次全面升级

独立评测给出的画面更清醒。有机构测出 Opus 5.5 在 60 个模型的排名中位列第四,得分甚至比上一代略低。OpenAI 自家的图表里也出现两处倒退——代码能力和电脑操作两项,新模型分数都低于上一代。

这次不是全面更强,是用一点分数换掉一半成本

换句话说,这轮发布的本质是用一点点性能,换掉一半的成本。行业不再执着于突破能力天花板,而是把力气花在同等任务下的价格竞争上。

把时间往前推十天,Anthropic 的 CEO 发过一篇题为《我们必须给前沿配速》的长文,呼吁整个行业放慢模型能力的提升。文章发出后,OpenAI 的 CEO 公开回应"我同意,我们需要给前沿配速",马斯克也附和了一句。三家最前沿的公司罕见地在这件事上站到了一起。然后十天后,两家各自发了更便宜的模型。这算不算"配速",各自理解——但主战场确实变了。

独立评测机构在比较 AI 模型时通常使用标准化基准测试,如编程能力(HumanEval、SWE-bench)、推理能力(MMLU、MATH)和代理操作(OSWorld、WebArena)等。这些分数能反映模型在特定任务上的相对表现,但有局限性:基准测试可能被针对性优化("刷榜"),且不代表真实业务场景下的体验。更重要的是,厂商在基准测试上主动回退,说明这轮训练的目标函数发生了改变——不再最大化能力得分,而是最小化推理成本,这是一个明确的战略信号,表明厂商认为当前市场对"够用且便宜"的需求已经超过了对"更强但更贵"的需求。

下游用脚投票:Harvey 的账本困境

价格战最真实的压力来自下游客户。据彭博报道,一家估值 156 亿美元的法律 AI 公司 Harvey,刚刚搬离了此前使用的前沿模型。原因不是能力不够,而是算不过账。

法律AI公司Harvey搬离前沿模型

Harvey 按席位收费,席位内不限用量,但它背后调用的模型是按 Token 计费的。结果一个每周只查一次的合伙人,和一个整夜跑分析的助理,付的是同样的钱。有人一针见血地总结:基于按量成本的固定价,本质就是一张有到期日的补贴券。

一年下来,Harvey 的 Token 用量涨了 20 倍,收入翻了一倍,但毛利率却从年初的正五成,跌到 6 月的负五成。这条曲线清楚地说明,光靠上游降价救不了下游的账本。

Harvey 的困境折射出 AI 应用层的普遍定价陷阱。按席位(Seat-based)收费是 SaaS 行业的经典模式,它对供应商友好,因为收入可预测;但当底层成本是随使用量线性增长的 Token 消耗时,这两套逻辑就会产生致命错位。在传统软件里,边际成本接近零,多一个重度用户几乎不增加成本;而在大模型 API 时代,一个深夜运行大规模合同分析的助理,其 Token 消耗可能是轻度用户的数百倍,但两者付的是完全相同的席位费。这种结构性矛盾在用量低增速下尚可掩盖,一旦平台使用深化,成本就会以超线性速度膨胀,侵蚀毛利。Harvey 的案例并非个例——几乎所有以固定包月价切入企业的 AI 应用都面临同样的隐患,差别只在于用量增长到哪一天触发危机。

自研模型与真正的成本杠杆

为扭转局面,Harvey 上线了自研模型,据称基于中国的 Kimi K3,毛利这才转正。但耐人寻味的是,Kimi K3 的单价只便宜了四成,远达不到九成的成本下降。

Harvey基于Kimi K3自研模型后毛利转正

真正起作用的是另外三件事:后训练优化、请求路由、以及按用量谈下来的产能条款。这提醒我们,该盯的从来不是 Token 单价,而是每完成一个任务的成本。按这个口径,Harvey 把一个法律任务的成本从 52 美元压到了 30 美元。不过需要注意,这些数字都出自它自己的测试,缺乏第三方验证。

后训练优化(Post-training Optimization)、请求路由(Request Routing)和产能条款(Capacity Agreements)是目前应用层控制推理成本最有效的三类手段,但各自需要相当的工程投入。后训练优化指在基础模型之上针对特定任务做进一步微调或蒸馏,使较小的模型在垂直场景下逼近大模型效果,从而降低每次推理所需的算力;请求路由则是根据任务复杂度自动分发——简单查询走轻量廉价模型,复杂推理才调用旗舰,避免"杀鸡用牛刀"式的成本浪费;产能条款是与云厂商或模型提供商协商按承诺用量换取大幅折扣的采购协议,类似批发定价,单价可比零售低数倍。这三者结合,才是 Harvey 实现成本从 52 美元降至 30 美元的真实路径,而非单纯依赖 Kimi K3 的较低单价。

价格战究竟在抢市场,还是在推走客户?

当上游厂商拼命降价、下游客户开始自己造模型,一个尖锐的问题浮出水面:这场价格战到底是在抢占市场,还是在把最有价值的客户推向自建方案?

从 Opus 5.5 和 GPT-6 系列同日降价,到 Harvey 的账本翻车与自研突围,整条链路都指向同一个信号——AI 竞争的核心指标正在从"能力分数"转向"单位任务成本"。对于依赖 API 的应用层公司来说,如何设计定价模型、优化路由与后训练,可能比选用哪家旗舰模型更能决定生死。

分享:

相关推荐