Claude Opus 5
Anthropic即将发布的旗舰模型,能力接近上一代旗舰水平,但推理成本显著降低,预计发布时间为2025年7月
核心事实
时间轴 (近 90 天)
Claude Opus 5 在 ThinkingBox 中 pass@20 为 79.09%,all-20 达到 47.53%(241个任务稳定通过)
在Automation Bench榜单上,Claude Opus 5的每任务成本是Sol的11倍
Claude Opus 5的默认effort(思考强度)为high,而Opus 5.5默认降到了medium
V4.1 Flash在更难的基准上落后:Terminal Bench 3.0得30.0对Opus 5的43.3,Terminal Bench 4.0得31.2对Opus 5的51.8,无工具版人类最后考试36.8对Opus 5的56.3
Anthropic称Opus 5.5典型任务总成本可降低约40%,输出速度提升30%以上
Opus 5.5 在多数任务上达到 Fable 5.1 的水平,但运行成本降低约 40%,速度也更快
在 Automation Bench 测试中,GPT-6 Sol 的 extra high 档拿下 33% 的第一名,而 5.6 的 max effort 得分为 28.8
Claude Opus 5.5在Anthropic报告的几乎所有基准测试上超越了Opus 5和Fable 5.1,尤其在智能体编程和真实世界知识工作方向领先
DeepSeek 4.1 Flash 在部分基准测试中能超越 Claude Opus 5、Kimi K3 等顶级模型,但并非全面领先
一位Reddit用户使用Claude Opus 5开发了名为amfly的开源实验性项目
还有 40 条时间轴事件
全部知识事实 (20)
Anthropic称Opus 5是迄今最对齐的模型,遵守宪法程度超过Sonnet 5和Fable,欺骗行为率最低
85%已验证Opus 5.5 在多数任务上达到 Fable 5.1 的水平,但运行成本降低约 40%,速度也更快
80%已验证Anthropic称Opus 5.5典型任务总成本可降低约40%,输出速度提升30%以上
70%已验证折算真实使用场景,Opus 5相对Fable的实际成本优势约为20%到25%,Fable单任务约2.75美元,Opus 5约2.03美元
65%已验证Opus 5 在 Low Effort 下的通过率约为 60%,超过了 Opus 4.8 在 Max 级别下的 59%,后者单任务成本高达 13 美元
65%已验证Claude 3.5 Sonnet在多数基准测试中已接近甚至超越早期Claude 3 Opus的表现
65%已验证Claude Opus 5是Anthropic于2025年发布的旗舰级大语言模型,代表Claude系列最高能力层级
60%已验证Anthropic 发布了 Claude Sonnet 5,官方宣称其性能接近 Opus 4.8 且价格更低
60%已验证Devin has integrated Anthropic's Claude Opus 5 model, live in Devin Desktop and Devin CLI
65%待验证能力提升型技能存在时效性问题,随着模型版本升级(如未来的Claude Opus 5),某些能力提升技能可能不再需要
70%待验证在 Automation Bench 测试中,GPT-6 Sol 的 extra high 档拿下 33% 的第一名,而 5.6 的 max effort 得分为 28.8
60%待验证V4.1-Flash在与GPT-5.6级别模型对比时分数高出1分
60%待验证努力参数(effort)控制的是模型的思考量而非说话量,降低努力不一定能可靠缩短可见回应,控制回应长度必须明确提示
60%待验证Opus 5依然擅长发现漏洞,但利用漏洞的能力被大幅削弱
60%待验证Claude Opus 5 approaches Fable-level performance on the FrontierCode 1.1 benchmark while costing only half as much
60%待验证Claude Opus 5 在 ThinkingBox 中 pass@20 为 79.09%,all-20 达到 47.53%(241个任务稳定通过)
50%待验证在Automation Bench榜单上,Claude Opus 5的每任务成本是Sol的11倍
50%待验证Claude Opus 5的默认effort(思考强度)为high,而Opus 5.5默认降到了medium
50%待验证V4.1 Flash在更难的基准上落后:Terminal Bench 3.0得30.0对Opus 5的43.3,Terminal Bench 4.0得31.2对Opus 5的51.8,无工具版人类最后考试36.8对Opus 5的56.3
50%待验证Claude Opus 5.5在Anthropic报告的几乎所有基准测试上超越了Opus 5和Fable 5.1,尤其在智能体编程和真实世界知识工作方向领先
50%