[KongchangAI]
Model

Claude Opus 5

Anthropic即将发布的旗舰模型,能力接近上一代旗舰水平,但推理成本显著降低,预计发布时间为2025年7月

Core Facts

Timeline (last 90 days)

Oct 9

Claude Opus 5 在 ThinkingBox 中 pass@20 为 79.09%,all-20 达到 47.53%(241个任务稳定通过)

Unverified50%
Oct 8

在Automation Bench榜单上,Claude Opus 5的每任务成本是Sol的11倍

Unverified50%
Oct 7

Claude Opus 5的默认effort(思考强度)为high,而Opus 5.5默认降到了medium

Unverified50%
Sep 27

V4.1 Flash在更难的基准上落后:Terminal Bench 3.0得30.0对Opus 5的43.3,Terminal Bench 4.0得31.2对Opus 5的51.8,无工具版人类最后考试36.8对Opus 5的56.3

Unverified50%
Sep 26

Anthropic称Opus 5.5典型任务总成本可降低约40%,输出速度提升30%以上

Verified70%
Sep 25

Opus 5.5 在多数任务上达到 Fable 5.1 的水平,但运行成本降低约 40%,速度也更快

Verified80%
Sep 25

在 Automation Bench 测试中,GPT-6 Sol 的 extra high 档拿下 33% 的第一名,而 5.6 的 max effort 得分为 28.8

Unverified60%
Sep 22

Claude Opus 5.5在Anthropic报告的几乎所有基准测试上超越了Opus 5和Fable 5.1,尤其在智能体编程和真实世界知识工作方向领先

Unverified50%
Sep 19

DeepSeek 4.1 Flash 在部分基准测试中能超越 Claude Opus 5、Kimi K3 等顶级模型,但并非全面领先

Expired50%
Sep 17

一位Reddit用户使用Claude Opus 5开发了名为amfly的开源实验性项目

Unverified50%

40 more timeline events

All Facts (20)

Verified

Anthropic称Opus 5是迄今最对齐的模型,遵守宪法程度超过Sonnet 5和Fable,欺骗行为率最低

85%
Verified

Opus 5.5 在多数任务上达到 Fable 5.1 的水平,但运行成本降低约 40%,速度也更快

80%
Verified

Anthropic称Opus 5.5典型任务总成本可降低约40%,输出速度提升30%以上

70%
Verified

折算真实使用场景,Opus 5相对Fable的实际成本优势约为20%到25%,Fable单任务约2.75美元,Opus 5约2.03美元

65%
Verified

Opus 5 在 Low Effort 下的通过率约为 60%,超过了 Opus 4.8 在 Max 级别下的 59%,后者单任务成本高达 13 美元

65%
Verified

Claude 3.5 Sonnet在多数基准测试中已接近甚至超越早期Claude 3 Opus的表现

65%
Verified

Claude Opus 5是Anthropic于2025年发布的旗舰级大语言模型,代表Claude系列最高能力层级

60%
Verified

Anthropic 发布了 Claude Sonnet 5,官方宣称其性能接近 Opus 4.8 且价格更低

60%
Verified

Devin has integrated Anthropic's Claude Opus 5 model, live in Devin Desktop and Devin CLI

65%
Unverified

能力提升型技能存在时效性问题,随着模型版本升级(如未来的Claude Opus 5),某些能力提升技能可能不再需要

70%
Unverified

在 Automation Bench 测试中,GPT-6 Sol 的 extra high 档拿下 33% 的第一名,而 5.6 的 max effort 得分为 28.8

60%
Unverified

V4.1-Flash在与GPT-5.6级别模型对比时分数高出1分

60%
Unverified

努力参数(effort)控制的是模型的思考量而非说话量,降低努力不一定能可靠缩短可见回应,控制回应长度必须明确提示

60%
Unverified

Opus 5依然擅长发现漏洞,但利用漏洞的能力被大幅削弱

60%
Unverified

Claude Opus 5 approaches Fable-level performance on the FrontierCode 1.1 benchmark while costing only half as much

60%
Unverified

Claude Opus 5 在 ThinkingBox 中 pass@20 为 79.09%,all-20 达到 47.53%(241个任务稳定通过)

50%
Unverified

在Automation Bench榜单上,Claude Opus 5的每任务成本是Sol的11倍

50%
Unverified

Claude Opus 5的默认effort(思考强度)为high,而Opus 5.5默认降到了medium

50%
Unverified

V4.1 Flash在更难的基准上落后:Terminal Bench 3.0得30.0对Opus 5的43.3,Terminal Bench 4.0得31.2对Opus 5的51.8,无工具版人类最后考试36.8对Opus 5的56.3

50%
Unverified

Claude Opus 5.5在Anthropic报告的几乎所有基准测试上超越了Opus 5和Fable 5.1,尤其在智能体编程和真实世界知识工作方向领先

50%

Source Articles