Anthropic Opus 5实测:性能超越对手价格仅一半

Anthropic罕见周五发布Opus 5:定价不变性能飙升
Anthropic此次的Opus 5发布可以说是近期最令人意外的一次。首先,这是该公司罕见地选择在周五发布新模型——通常大厂会避开周末流量低谷。但更值得关注的是模型本身的表现:据YouTube频道的实测分析,Opus 5在几乎所有主要基准测试上都超越了竞品Fable 5,而定价却只有对方的一半。
这种"性能翻倍、价格减半"的组合,在当前竞争白热化的前沿模型市场中极具杀伤力。更关键的是,Opus 5沿用了Opus 4.8的定价体系——Anthropic在很长一段时间内都没有上调Opus和Sonnet系列的价格,却在每一代都带来实打实的智能提升。对消费者而言,这意味着单位算力成本在持续下降,本质上是算力领域的"摩尔定律"正在AI推理服务中重现。
ARC-AGI-3基准首破30%:抽象推理能力质变
评估前沿模型时,第三方基准往往比官方数据更具参考价值。而Opus 5在这方面的表现堪称亮眼。
在ARC-AGI-3(RKGI3)测试中,Opus 5成为首个突破30%的模型,几乎是此前最强模型成绩的三倍。ARC-AGI(Abstraction and Reasoning Corpus for Artificial General Intelligence)由AI研究者François Chollet于2019年提出,旨在测试AI系统的流体智力——即在没有先验训练数据的情况下,面对全新问题时进行抽象推理和模式发现的能力。与传统NLP基准不同,ARC测试使用彩色网格变换任务,每道题仅给出2-3个输入输出示例,要求模型归纳出变换规则并应用到新输入上。ARC-AGI-3是该系列的第三代版本,难度进一步提升,增加了更多需要组合推理和多步抽象的题目。此前大多数顶尖LLM在该基准上的得分率徘徊在10%-15%,ARC系列基准以考验模型的抽象推理和泛化能力著称,一直是LLM的薄弱环节,这一突破意味着模型在"真正理解"而非"模式匹配"层面有了实质进展。
在前端设计能力上,Opus 5同样达到业界顶尖水平——这本就是Opus系列的传统强项。综合来看,它可以被概括为"Fable级别的模型,却卖着更便宜的价格"。值得一提的是,Anthropic有意削减了模型的网络安全(攻击)相关能力,这一取舍反而让模型得以按时发布,无需等待政府审查流程,对普通用户来说是好事。

Agentic编程实测:Opus 5展现真正的AI能动性
如果说基准分数只是数字,那么一个具体案例更能说明Opus 5的能力边界。
Agentic编程是2024-2025年AI领域最重要的范式转变之一。传统的LLM使用方式是"人提问-模型回答"的单轮或多轮对话,而agentic模式下,模型被赋予工具调用、环境交互、自主规划的能力,能够像一个独立代理人(agent)一样分解任务、制定计划、执行操作并根据反馈调整策略。
在一项测试任务中,模型被给到一张机械零件的工程图纸,要求编写代码将其在FreeCAD中重建为3D模型。棘手之处在于——模型并没有被赋予直接"查看"图纸的能力。结果,Opus 5自行搭建了一套计算机视觉流水线,从原始像素中提取几何信息,再完成重建。这种主动寻找解决路径的行为,正是所谓"agency(能动性)"的体现——模型不仅解决问题,还能自主构建解决问题所需的工具链。这种"元认知"式的问题解决能力,是agentic编程时代模型的核心竞争力。
Cursor与Devin基准对比
Cursor是由Anysphere公司开发的AI原生代码编辑器,基于VS Code架构构建,深度集成了多种前沿LLM,已成为开发者社区中最受欢迎的AI辅助编程工具之一。Devin则由Cognition Labs开发,定位为"全自动AI软件工程师",其Frontier Code基准专注于衡量模型在真实软件工程任务中的端到端完成能力。这两个平台的独立测试结果具有较高参考价值,因为它们反映的是模型在实际开发工作流中的表现,而非孤立的学术基准。
在Cursor的第三方基准中,Opus 5在max档位下已非常接近Fable 5的max表现,但价格却不到一半;而在high档位下,它甚至反超了Fable 5。同样有意思的是,Opus 5仅在extra-high档位就已超越了处于max档位的GPT-5.6。Devin的Frontier Code基准也显示,Opus 5与Cloud Fable 5基本持平。多个独立来源的数据交叉印证:这确实是一款极具竞争力的编程模型。
Opus 5定价与Token消耗分析:实际成本可控
此前有报道称Opus 5会更加"token饥渴",即为达到同等性能需要消耗更多token,从而推高实际使用成本。在LLM的商业定价体系中,费用按输入token和输出token分别计价。所谓"token饥渴"是指模型为完成同一任务需要生成更多的中间推理token或更长的输出,导致即使单价不变,实际账单也会上涨。这一现象在引入扩展推理机制后变得尤为突出——模型的"思考过程"本身也消耗token。因此,评估模型的真实性价比不能仅看单价,还需考察"达到目标性能所需的总token消耗"。
但从不同effort等级的性能-成本曲线看,情况并没有那么糟。在相同性能水平下,Opus 5相比Opus 4.8并未显著增加token消耗,甚至在某些情况下能以更低成本达到更高性能。当然,在最高effort档位追求极致表现时,成本确实会上升——但在真实任务中不太会构成实质负担。

思维预算对性能的影响
思维预算(thinking budget)是扩展推理(extended thinking)技术的核心控制参数。自OpenAI的o1模型开创"思维链推理"范式以来,主流前沿模型都引入了类似机制:在生成最终答案之前,模型会进行一段内部"思考"过程,将复杂问题拆解为多个推理步骤。思维预算决定了模型在这一过程中可以消耗的token上限——预算越高,模型思考越深入,推理质量通常越好,但算力成本也相应增加。这本质上是test-time compute(推理时计算)的一种实现:通过在推理阶段投入更多计算资源来提升模型表现,而非依赖更大的预训练规模。
曲线显示,提高思考等级会带来性能增长,代价是更多算力开销。在agentic编程场景下,Opus 5在所有思考档位上都稳定超越GPT-5.6。
不过测评者也直言不讳地指出了一处"图表小动作":在agentic coding的对比图中,53.4%被画得比53.5%还高。虽然差距微乎其微,但对一向以诚实著称的Anthropic来说,这种做法多少令人意外。
实测任务:从Pokemon百科到ISS实时追踪器
模型发布即上线cloud.ai与Claude Code,并支持100万token上下文。100万token的上下文窗口大约相当于750万个英文单词,或约15000页标准文档,这一能力对于企业级应用至关重要——开发者可以一次性将整个代码仓库、完整的技术文档集、或大量历史对话记录输入模型,让其在充分理解全局上下文的基础上进行推理和生成。在agentic编程场景中,长上下文尤其关键,因为agent在执行多步骤任务时需要持续追踪之前的操作结果、错误信息和环境状态。这一点延续了Anthropic"发布即可用"的传统。
测试一:传说宝可梦百科生成
第一个测试是生成"前25只传说宝可梦百科"。以往LLM的输出多是堆叠式卡片,但Opus 5这次发挥了相当的创意自由度,生成了一个设计精美、毫无"模板感"的网站。这印证了Opus系列在Web设计上的一贯强项。

测试二:3D场景与交互控制
第二个测试涉及3D场景与相机控制,模型不仅渲染出类似乐高小人的可爱模型,还在追加要求后成功加入了缩放、视角控制等交互功能。
测试三:ISS国际空间站实时追踪器
最具挑战性的是ISS(国际空间站)实时追踪器任务。ISS以约28000公里/小时的速度环绕地球运行,每90分钟绑定一圈,实时追踪它需要模型理解轨道力学的基本概念,并调用实时定位API获取数据。这项任务耗时极长——在cloud.ai上生成过程明显慢于Opus 4.8(部分可能因服务器繁忙)。但最终成果令人惊艳:不仅显示了空间站的准确当前位置,还提供了轨道路径、地面覆盖范围、追踪开关等丰富细节。测评者表示,其精细程度"前所未见",完全可以替代现成的专业网站。

Opus 5长期表现展望:基准亮眼能否经受实战考验
一个耐人寻味的推测是:如果Opus级别的模型仅用一次迭代就能超越Fable级别,那么Fable、Metis这类更高阶模型或许会逐渐成为普通消费者接触不到的"内部/项目级"产品,而Anthropic可能会继续沿用过去几年简洁的命名策略。这种产品分层策略在科技行业并不罕见——类似于芯片行业中消费级与数据中心级产品的分野,前沿AI公司可能也在形成"消费级旗舰"与"企业/研究级超旗舰"的双轨体系。
需要提醒的是,Anthropic在Opus 4.7和4.8上曾有过"翻车"经历——基准亮眼但真实表现不佳,反倒是4.6口碑扎实。这种"基准与实战脱节"的现象在AI行业被称为Goodhart定律的体现——当一个指标成为优化目标时,它就不再是一个好的指标。模型可能在特定基准的分布上过拟合,却在分布外的真实任务中表现平平。因此,本次的一手实测虽然极为正面,但仍属"第一印象"级别,真正的考验在于production环境下的长期表现。测评者已表示将用自己实际开发的应用做更深入的测评。
就目前而言,无论是三方基准、agentic编程能力,还是Web设计与复杂任务实测,Opus 5都交出了一份令人信服的答卷。Anthropic这次确实再次证明了自己的实力。
核心要点
相关推荐

Qwen-Audio-3.0-TTS语音模型发布:登顶TTS排行榜首位
阿里通义千问发布Qwen-Audio-3.0-TTS文本转语音模型,登顶Artificial Analysis TTS排行榜第一。支持16种语言、细粒度情感控制、自然语言指令调控语音风格,提供Flash实时版和Plus高质量版双版本。

Qwen3.8-Max预览版持续迭代,前端开发能力大幅提升
阿里通义千问Qwen3.8-Max-Preview版本每日迭代更新,Web前端开发能力显著提升。团队采用开放预览策略收集社区反馈,并承诺正式版将开源权重向所有人开放。

QwenGrowthPlan千问成长计划:真实任务驱动AI模型迭代新范式
阿里通义千问推出QwenGrowthPlan成长计划,邀请开发者用真实任务反馈推动Qwen3.8-Max模型迭代优化。深度解析该计划对agentic智能体能力提升、社区共建生态和大模型竞争格局的深远影响。