[KongchangAI]
Model

Opus 5

Anthropic据传即将发布的旗舰级大语言模型,传闻将取代Fable模型,代表Claude家族Opus系列的第五代产品

Core Facts

Timeline (last 90 days)

Oct 6

在约145个技能的14项测试中,Jev找到正确技能平均耗时5秒内,而默认用Opus 5需要约30秒

Unverified50%
Oct 5

Box团队将Opus 5.5用于企业知识工作,相比Opus 5节省63% token、减少42%冗余、提速30%,金融服务任务准确率提升39%,云成本分析提升65%

Unverified50%
Oct 4

推理模型在过高努力档位会出现 overthinking(过度推理),导致推翻原本正确答案,Anthropic 的 Opus 5 也观察到类似规律

Unverified50%
Oct 3

在相同代码库、相同prompt、相同高推理强度的对比中,Opus 5.5只用一段话给出核心信息,而Opus 5在给出推理步骤后产出偏冗长的最终回答

Unverified50%
Oct 3

被作者批评后,Opus 5.5只简短道歉并给出一句话总结,而Opus 5则用整段文字自我检讨并使用「这是诚实版本」等话术

Unverified50%
Oct 1

根据Artificial Analysis的数据,从Opus 5到Opus 5.5每个任务的推理token数从约4.2万翻倍增至8.4万,而输出token仅从3万增至3.5万

Unverified50%
Sep 30

相较上一代 Opus 5,Opus 5.5 典型使用成本大约下降四成,输出速度提升三成以上

Unverified50%
Sep 30

Anthropic上线Cloud Opus 5.5,能力接近旗舰Fable 5.1,成本下降40%,输出速度较Opus 5提升超30%

Unverified50%
Sep 29

在电脑操作类任务上Astra最强,Sol得分60.5%与Opus 5的60.3%接近,单任务成本约低八成

Unverified50%
Sep 29

Luna编程测试得66.6%,成本比Opus 5、Fable 5分别低93%和96%

Unverified50%

40 more timeline events

All Facts (20)

Verified

Opus 5.5 在多数任务上达到 Fable 5.1 的水平,但运行成本降低约 40%,速度也更快

80%
Verified

Anthropic称Opus 5.5典型任务总成本可降低约40%,输出速度提升30%以上

70%
Verified

Claude Opus 5.5的生成速度比Opus 5快超过30%

70%
Verified

V4.1 Flash在DeepSWE基准上以0.2分的微弱优势超过Opus 5

70%
Verified

折算真实使用场景,Opus 5相对Fable的实际成本优势约为20%到25%,Fable单任务约2.75美元,Opus 5约2.03美元

65%
Verified

Opus 5 在 Low Effort 下的通过率约为 60%,超过了 Opus 4.8 在 Max 级别下的 59%,后者单任务成本高达 13 美元

65%
Verified

Claude Opus 5能力接近上一代旗舰Opus水平,但推理成本显著降低

65%
Unverified

发布方宣称DeepSeek-V4.1-Flash的成本仅为Opus 5和GPT-5.6 Sol的1/40

70%
Partially Verified

GPT-6 Sol High在Automation Bench上的单项任务成本仅为Opus 5的十分之一

65%
Unverified

Opus 5能在单次生成中处理3D场景构建、碰撞检测、用户输入响应和音频触发等多个技术层面

60%
Unverified

Opus 5是Anthropic旗下Claude系列的旗舰模型,以更长的上下文窗口(可处理数十万token的代码库)和更谨慎的输出风格著称

60%
Unverified

Claude Opus 5在ARC-AGI-3上得分30.2%,而上一代仅1.5%

60%
Unverified

Claude Opus 5在知识工作基准GDPval上得分1861,高于人类平均水平

60%
Unverified

SWE-1.7被宣称在编程智能水平上已接近GPT-5.5和Claude Opus的表现

60%
Unverified

在约145个技能的14项测试中,Jev找到正确技能平均耗时5秒内,而默认用Opus 5需要约30秒

50%
Unverified

Box团队将Opus 5.5用于企业知识工作,相比Opus 5节省63% token、减少42%冗余、提速30%,金融服务任务准确率提升39%,云成本分析提升65%

50%
Unverified

推理模型在过高努力档位会出现 overthinking(过度推理),导致推翻原本正确答案,Anthropic 的 Opus 5 也观察到类似规律

50%
Unverified

在相同代码库、相同prompt、相同高推理强度的对比中,Opus 5.5只用一段话给出核心信息,而Opus 5在给出推理步骤后产出偏冗长的最终回答

50%
Unverified

被作者批评后,Opus 5.5只简短道歉并给出一句话总结,而Opus 5则用整段文字自我检讨并使用「这是诚实版本」等话术

50%
Unverified

根据Artificial Analysis的数据,从Opus 5到Opus 5.5每个任务的推理token数从约4.2万翻倍增至8.4万,而输出token仅从3万增至3.5万

50%

Source Articles