Claude Opus 5深度评测:半价超越Fable,成本效率登顶

Opus 5:更强、更便宜的意外之作
Anthropic发布了Claude Opus 5,这是一个让科技圈感到意外的模型。要理解它的意义,先回顾Anthropic的模型家族谱系:Haiku、Sonnet、Opus构成基础三层,随后旗舰级的Fable横空出世成为其"最大最强"的模型。Anthropic自2023年起建立了以诗歌/文学体裁命名的多层级模型体系——Haiku(俳句)定位为轻量级快速响应模型,适合简单任务和高吞吐场景;Sonnet(十四行诗)为中端平衡型,兼顾性能与成本;Opus(乐章)为高端旗舰,主打复杂推理与长文本处理。这种多层级策略与OpenAI的GPT-mini/GPT/o系列、Google的Nano/Flash/Pro/Ultra体系类似,目的是让不同预算和需求的用户都能找到合适的模型切入点。然而现在,Opus 5的到来打破了这个层级——它在几乎所有基准测试上都超越了Fable 5,价格却只有后者的一半。
据科技博主Matthew Berman的实测分析,这一结果几乎出乎所有人的预料。他直言:"Opus竟然在跑分上压过了Fable,这太疯狂了。"更关键的是,Opus 5的定价为每百万输入token 5美元、每百万输出token 25美元,与前代Opus 4.8持平,却达到了Fable一半的价格,与OpenAI的GPT 5.6 soul形成正面竞争。这里需要理解大模型API的计费逻辑:Token是文本被分词器切分后的最小语义片段,英文中一个token大约对应4个字符或0.75个单词,中文通常一个汉字对应1-2个token。输入token和输出token分开计价,输出token通常比输入贵3-5倍,因为生成过程需要逐token自回归解码,计算量远大于编码阶段。这也是为什么后文Berman会强调"每任务成本"比"每token价格"更有参考价值——不同模型完成同一任务所消耗的token总量可能差异巨大。
可以说,Opus 5是Anthropic对GPT 5.6 soul的直接回应,而后者很可能是GPT 5系列在GPT 6发布前的最后一次迭代。
基准测试全面碾压:Opus 5跑分详解
从公布的基准数据看,Opus 5的表现堪称惊艳:
编程与智能体能力
在Frontier Bench这一对编程至关重要的基准上,Opus 5拿到43分,而Fable仅为33分。Frontier Bench是专门评估前沿AI模型编程能力的基准测试套件,涵盖代码生成、调试、重构、多文件工程理解等维度,难度远超传统的HumanEval或MBPP——它的题目通常来自真实的开源项目issue和pull request,要求模型理解复杂的代码库上下文后给出正确修改方案。在OpenAI创建的GDP Val(测试真实世界实用任务,涵盖数据处理、文档分析、工具调用等综合场景)上,相比Fable 5实现了整整100分的提升。在OS World(计算机操作能力基准,测试模型控制屏幕、识别位置、点击按钮完成任务的能力)上也有4分的进步。OS World的重要性在于它测试的是模型作为智能体(agent)操控计算机桌面环境的能力,涉及视觉理解、空间定位、动作规划和多步执行,是通往通用AI助手的关键能力之一。

ARC AGI 3的惊人跃升
最令人震撼的是ARC AGI 3的成绩。ARC(Abstraction and Reasoning Corpus)由François Chollet于2019年提出,被认为是衡量机器"真正智能"的黄金标准之一。与其他基准不同,ARC的核心理念是测试模型的"样本外泛化"能力:每道题都是一个全新的视觉模式推理任务,无法通过记忆训练数据来作弊。ARC AGI 3作为第三代版本进一步提高了难度,将测试场景扩展到类似未知游戏的交互式环境中——它只给模型一个游戏,不告诉名称、不解释玩法、不说明如何通关,模型被"扔进去"后必须自行摸索完成。此前世界最强模型在这里大约只能拿到8%,部分原因是这类任务需要真正的抽象推理和快速假设验证能力,而非大规模语言模式匹配。而Opus 5一举跃升至30%——Berman认为,连ARC Prize团队恐怕都没预料到这样的飞跃。ARC Prize基金会为此设立了总额超过100万美元的奖金,旨在推动AGI研究的实质性进展,Opus 5的这一成绩无疑让整个研究社区为之震动。

有得有失:部分基准的回落
当然,并非全面完胜。在法律基准上,成绩从13.3降至11.7;HealthBench Professional也有下降;而Berman个人最看重的DeepSUI基准出现了轻微下滑。他坦言,DeepSUI的这个小幅回落,可能才是用户实际使用时"体感"最接近的信号。
成本效率:Opus 5真正的杀手锏
如果说跑分是表面文章,那么Opus 5真正的价值在于"每任务成本"(cost per task)这一维度。
Berman在过去几周反复强调这个指标的重要性。他指出,仅看每token价格已经不够了。以Kimi K3为例,它的价格是GPT 5.6 soul的一半、不到Fable 5的一半,但完成同样任务需要两倍的token,最终成本其实持平。"半价"的标签在实际使用中变成了一场空欢喜。这里的根本原因在于,不同模型的推理效率差异巨大——有些模型需要生成大量中间推理步骤(chain-of-thought)才能到达正确答案,而效率更高的模型可能用更少的token就能完成同样的任务,因此单纯比较token单价会产生严重的误导。
而Opus 5在OS World基准上,不仅性能领先,成本也显著更低。数据显示,要用其他模型匹配Opus 5最低设置下的性能,成本竟需超过两倍以上。在ARC AGI 3上,Opus 5拿到30分的同时,成本比GPT 5.6 soul还低,得分却是后者的三倍多。
这种"既便宜又强"的组合极为罕见。Berman推测,Anthropic很可能是用Fable来蒸馏优化Opus,从而在低成本下压榨出最大性能。知识蒸馏(Knowledge Distillation)是由Geoffrey Hinton等人于2015年提出的模型压缩技术,其核心思想是用一个大型"教师模型"的输出分布来指导一个小型"学生模型"的训练。蒸馏过程中,教师模型的"软标签"(soft labels)包含了比硬标签更丰富的类间关系信息——例如教师模型认为答案A有80%概率正确、答案B有15%概率正确,这种概率分布本身就编码了深层知识。Fable作为参数量更大的教师模型,将其高级推理能力"压缩"传递给了规模更小的Opus 5,从而实现了"用更少计算资源达到更强性能"的效果。这也印证了Berman此前的判断:Fable高昂的token消耗只是第一版的问题,后续必然会被极致优化。
企业级实测:多步分析显优势
本视频赞助商Box对Opus 5进行了大量测试。他们的基准覆盖12个行业的真实文档任务,模拟知识工作者的实际工作:阅读源文档、核对数字、进行尽职调查、审查专家输出中的错误。

对比前代Opus 4.8,结果显示出明显提升:尽职调查从63分升至70分,从数据生成报告从65分升至76分,数据分析实现了6分的大跳跃。Box的结论是:在复杂企业知识工作上,Opus 5相比前代是"明显的进步",其优势集中体现在驱动真实决策的"详尽多步分析"上。
有意为之的能力削减:网络安全策略
Opus 5唯一明显落后的领域是网络安全能力,而这很可能是Anthropic的刻意设计。
数据显示,在漏洞利用成功率上,无护栏的Mythos模型达到13%,Opus 4.8为0%,而Opus 5为4%。Berman推测,Anthropic不仅给Opus 5加了护栏,还可能在训练层面主动移除了部分网络攻击能力。在AI安全领域,"护栏"(guardrails)通常指在模型推理阶段添加的过滤层,包括输入审核、输出检测和安全分类器等,它们不改变模型本身的能力,只是阻止危险输出的呈现。而在训练层面主动移除特定能力(被称为"capability elicitation prevention"或"unlearning")则更为根本——护栏可以被越狱(jailbreak)绕过,而训练层面的移除意味着模型从根本上"不会"而非"不愿"。
有趣的是,通常削减模型能力会连带损害整体性能,因为神经网络的知识是高度纠缠的,移除某一类知识往往会波及相邻能力。但Opus 5却呈现了相反效果——在削弱网络攻击能力的同时提升了整体质量。这可能暗示Anthropic在"精准外科手术式"的能力移除技术上取得了突破。Berman认为,这种对安全的克制或许正是Opus 5"不会被下架"、能够长期存续的原因,甚至猜测Anthropic可能已提前向美国政府展示了模型与评分。

此外,Opus 5的API引入了自动回退机制:被安全分类器标记的请求可自动路由到其他模型,但用户需支付回退模型的价格。Berman对此并不认可,认为这种设计有些恼人,并担心分类器可能过于激进。
Claude 5家族完整布局与三足鼎立格局
Anthropic的Tariq表示,Opus 5"完美收尾了Claude 5家族"——这句话也引发了Haiku 5是否还会推出的疑问。官方建议将Opus 5作为日常主力,搭配Fable用于规划、头脑风暴或修复最棘手的Bug。
说个细节,如今位于"帕累托前沿"(质量与成本的最优组合)的模型有三个:Opus 5、GPT 5.6 soul,以及开源模型Kimi K3。帕累托前沿这一概念源自意大利经济学家Vilfredo Pareto的最优理论:在多目标优化中,帕累托最优是指不可能在不损害某一目标的前提下改善另一目标的状态。将其应用到AI模型评估中,横轴代表每任务成本,纵轴代表模型性能,帕累托前沿上的模型意味着在同等成本下没有更强的模型,在同等性能下没有更便宜的模型。这三个模型共同构成这条前沿线,分别代表了不同价位段的最优选择,标志着AI市场已从单纯的"性能军备竞赛"转向"效率军备竞赛"。这也意味着闭源与开源阵营在成本效率的战场上正形成三足鼎立之势。
Opus 5已在所有平台上线,并将很快接入Box AI。对于开发者和企业用户而言,这场围绕"每任务成本"展开的竞争,正在重新定义大模型的价值衡量标准。
相关推荐

RAMageddon内存末日:AI抢占芯片产能,消费电子供应告急
AI训练需求引发"RAMageddon"内存末日危机,HBM和DDR5芯片被数据中心大量吞噬,智能手机、笔记本等消费电子面临供应短缺和涨价压力。深度解析产业链应对策略与长期影响。

Claude Code学术研究技能:五阶段全流程科研AI助手框架解析
深度解析GitHub热门项目academic-research-skills,详解Claude Code如何通过Research、Write、Review、Revise、Finalize五阶段Skills机制,构建结构化学术研究工作流,助力科研写作效率提升。

OKF Agent Memory:Git原生记忆如何解决AI编程助手失忆问题
深入解析OKF Agent Memory开源项目,探讨其Git原生持久化记忆方案如何解决Cursor、Copilot等AI编程助手的上下文遗忘难题,对比向量数据库等主流记忆方案的优劣。