Claude Opus 5
Anthropic即将发布的旗舰模型,能力接近上一代旗舰水平,但推理成本显著降低,预计发布时间为2025年7月
Core Facts
Timeline (last 90 days)
Claude Opus 5 在 ThinkingBox 中 pass@20 为 79.09%,all-20 达到 47.53%(241个任务稳定通过)
在Automation Bench榜单上,Claude Opus 5的每任务成本是Sol的11倍
Claude Opus 5的默认effort(思考强度)为high,而Opus 5.5默认降到了medium
V4.1 Flash在更难的基准上落后:Terminal Bench 3.0得30.0对Opus 5的43.3,Terminal Bench 4.0得31.2对Opus 5的51.8,无工具版人类最后考试36.8对Opus 5的56.3
Anthropic称Opus 5.5典型任务总成本可降低约40%,输出速度提升30%以上
Opus 5.5 在多数任务上达到 Fable 5.1 的水平,但运行成本降低约 40%,速度也更快
在 Automation Bench 测试中,GPT-6 Sol 的 extra high 档拿下 33% 的第一名,而 5.6 的 max effort 得分为 28.8
Claude Opus 5.5在Anthropic报告的几乎所有基准测试上超越了Opus 5和Fable 5.1,尤其在智能体编程和真实世界知识工作方向领先
DeepSeek 4.1 Flash 在部分基准测试中能超越 Claude Opus 5、Kimi K3 等顶级模型,但并非全面领先
一位Reddit用户使用Claude Opus 5开发了名为amfly的开源实验性项目
40 more timeline events
All Facts (20)
Anthropic称Opus 5是迄今最对齐的模型,遵守宪法程度超过Sonnet 5和Fable,欺骗行为率最低
85%VerifiedOpus 5.5 在多数任务上达到 Fable 5.1 的水平,但运行成本降低约 40%,速度也更快
80%VerifiedAnthropic称Opus 5.5典型任务总成本可降低约40%,输出速度提升30%以上
70%Verified折算真实使用场景,Opus 5相对Fable的实际成本优势约为20%到25%,Fable单任务约2.75美元,Opus 5约2.03美元
65%VerifiedOpus 5 在 Low Effort 下的通过率约为 60%,超过了 Opus 4.8 在 Max 级别下的 59%,后者单任务成本高达 13 美元
65%VerifiedClaude 3.5 Sonnet在多数基准测试中已接近甚至超越早期Claude 3 Opus的表现
65%VerifiedClaude Opus 5是Anthropic于2025年发布的旗舰级大语言模型,代表Claude系列最高能力层级
60%VerifiedAnthropic 发布了 Claude Sonnet 5,官方宣称其性能接近 Opus 4.8 且价格更低
60%VerifiedDevin has integrated Anthropic's Claude Opus 5 model, live in Devin Desktop and Devin CLI
65%Unverified能力提升型技能存在时效性问题,随着模型版本升级(如未来的Claude Opus 5),某些能力提升技能可能不再需要
70%Unverified在 Automation Bench 测试中,GPT-6 Sol 的 extra high 档拿下 33% 的第一名,而 5.6 的 max effort 得分为 28.8
60%UnverifiedV4.1-Flash在与GPT-5.6级别模型对比时分数高出1分
60%Unverified努力参数(effort)控制的是模型的思考量而非说话量,降低努力不一定能可靠缩短可见回应,控制回应长度必须明确提示
60%UnverifiedOpus 5依然擅长发现漏洞,但利用漏洞的能力被大幅削弱
60%UnverifiedClaude Opus 5 approaches Fable-level performance on the FrontierCode 1.1 benchmark while costing only half as much
60%UnverifiedClaude Opus 5 在 ThinkingBox 中 pass@20 为 79.09%,all-20 达到 47.53%(241个任务稳定通过)
50%Unverified在Automation Bench榜单上,Claude Opus 5的每任务成本是Sol的11倍
50%UnverifiedClaude Opus 5的默认effort(思考强度)为high,而Opus 5.5默认降到了medium
50%UnverifiedV4.1 Flash在更难的基准上落后:Terminal Bench 3.0得30.0对Opus 5的43.3,Terminal Bench 4.0得31.2对Opus 5的51.8,无工具版人类最后考试36.8对Opus 5的56.3
50%UnverifiedClaude Opus 5.5在Anthropic报告的几乎所有基准测试上超越了Opus 5和Fable 5.1,尤其在智能体编程和真实世界知识工作方向领先
50%