Opus 5
Anthropic据传即将发布的旗舰级大语言模型,传闻将取代Fable模型,代表Claude家族Opus系列的第五代产品
Core Facts
Timeline (last 90 days)
在约145个技能的14项测试中,Jev找到正确技能平均耗时5秒内,而默认用Opus 5需要约30秒
Box团队将Opus 5.5用于企业知识工作,相比Opus 5节省63% token、减少42%冗余、提速30%,金融服务任务准确率提升39%,云成本分析提升65%
推理模型在过高努力档位会出现 overthinking(过度推理),导致推翻原本正确答案,Anthropic 的 Opus 5 也观察到类似规律
在相同代码库、相同prompt、相同高推理强度的对比中,Opus 5.5只用一段话给出核心信息,而Opus 5在给出推理步骤后产出偏冗长的最终回答
被作者批评后,Opus 5.5只简短道歉并给出一句话总结,而Opus 5则用整段文字自我检讨并使用「这是诚实版本」等话术
根据Artificial Analysis的数据,从Opus 5到Opus 5.5每个任务的推理token数从约4.2万翻倍增至8.4万,而输出token仅从3万增至3.5万
相较上一代 Opus 5,Opus 5.5 典型使用成本大约下降四成,输出速度提升三成以上
Anthropic上线Cloud Opus 5.5,能力接近旗舰Fable 5.1,成本下降40%,输出速度较Opus 5提升超30%
在电脑操作类任务上Astra最强,Sol得分60.5%与Opus 5的60.3%接近,单任务成本约低八成
Luna编程测试得66.6%,成本比Opus 5、Fable 5分别低93%和96%
40 more timeline events
All Facts (20)
Opus 5.5 在多数任务上达到 Fable 5.1 的水平,但运行成本降低约 40%,速度也更快
80%VerifiedAnthropic称Opus 5.5典型任务总成本可降低约40%,输出速度提升30%以上
70%VerifiedClaude Opus 5.5的生成速度比Opus 5快超过30%
70%VerifiedV4.1 Flash在DeepSWE基准上以0.2分的微弱优势超过Opus 5
70%Verified折算真实使用场景,Opus 5相对Fable的实际成本优势约为20%到25%,Fable单任务约2.75美元,Opus 5约2.03美元
65%VerifiedOpus 5 在 Low Effort 下的通过率约为 60%,超过了 Opus 4.8 在 Max 级别下的 59%,后者单任务成本高达 13 美元
65%VerifiedClaude Opus 5能力接近上一代旗舰Opus水平,但推理成本显著降低
65%Unverified发布方宣称DeepSeek-V4.1-Flash的成本仅为Opus 5和GPT-5.6 Sol的1/40
70%Partially VerifiedGPT-6 Sol High在Automation Bench上的单项任务成本仅为Opus 5的十分之一
65%UnverifiedOpus 5能在单次生成中处理3D场景构建、碰撞检测、用户输入响应和音频触发等多个技术层面
60%UnverifiedOpus 5是Anthropic旗下Claude系列的旗舰模型,以更长的上下文窗口(可处理数十万token的代码库)和更谨慎的输出风格著称
60%UnverifiedClaude Opus 5在ARC-AGI-3上得分30.2%,而上一代仅1.5%
60%UnverifiedClaude Opus 5在知识工作基准GDPval上得分1861,高于人类平均水平
60%UnverifiedSWE-1.7被宣称在编程智能水平上已接近GPT-5.5和Claude Opus的表现
60%Unverified在约145个技能的14项测试中,Jev找到正确技能平均耗时5秒内,而默认用Opus 5需要约30秒
50%UnverifiedBox团队将Opus 5.5用于企业知识工作,相比Opus 5节省63% token、减少42%冗余、提速30%,金融服务任务准确率提升39%,云成本分析提升65%
50%Unverified推理模型在过高努力档位会出现 overthinking(过度推理),导致推翻原本正确答案,Anthropic 的 Opus 5 也观察到类似规律
50%Unverified在相同代码库、相同prompt、相同高推理强度的对比中,Opus 5.5只用一段话给出核心信息,而Opus 5在给出推理步骤后产出偏冗长的最终回答
50%Unverified被作者批评后,Opus 5.5只简短道歉并给出一句话总结,而Opus 5则用整段文字自我检讨并使用「这是诚实版本」等话术
50%Unverified根据Artificial Analysis的数据,从Opus 5到Opus 5.5每个任务的推理token数从约4.2万翻倍增至8.4万,而输出token仅从3万增至3.5万
50%