Claude Opus 5
Anthropic即将发布的旗舰模型,能力接近上一代旗舰水平,但推理成本显著降低,预计发布时间为2025年7月
核心事实
时间轴 (近 90 天)
在BrowseComp智能体搜索基准上模型得分30.8%,与GPT系列基本持平
在Automation Bench自动化基准上Claude Opus 5拿到约25%通过率,其他模型普遍聚集在15%左右
博主判断该代模型不是断层式智力跃升,而是在同等或更好效果下大幅降低成本
在GDPval知识工作基准上模型得分1861,高于人类平均水平
在ARC-AGI-3新颖问题解决基准上模型得分30.2%,而上一代仅1.5%
Theo认为Claude Opus 5可能是唯一需要的编码模型,成为其日常编码首选
Theo实测发现一整天重度工作只消耗周额度的12%,而同样强度用Fable一天能烧掉一个半周的额度
Opus 5擅长发现漏洞但利用漏洞的能力被大幅削弱,属于内化式对齐
Anthropic称Opus 5是迄今最对齐的模型,遵守宪法的程度超过4.8、Sonnet 5和Fable,欺骗行为率最低
折算真实使用场景,Opus 5相对Fable的实际成本优势约为20%到25%,Fable单任务约2.75美元,Opus 5约2.03美元
还有 40 条时间轴事件
全部知识事实 (20)
Devin has integrated Anthropic's Claude Opus 5 model, live in Devin Desktop and Devin CLI
95%待验证Claude Opus 5 is Anthropic's flagship large language model released in 2025, representing the highest capability tier in the Claude series
90%待验证Claude Opus 5 will be incorporated into Devin Cloud's mode mix
90%待验证Claude Opus 5 approaches Fable-level performance on the FrontierCode 1.1 benchmark while costing only half as much
80%已验证Claude Opus 4.7的定价为输入$5.00/百万token,输出$25.00/百万token
80%已验证本次对 Claude Opus 4.8 的多场景深度测试总计花费约 50 美元 Token 费用
70%已验证Claude Opus 4.8's price is unchanged compared to Claude Opus 4.7
70%待验证任何大模型的输出Token都比输入Token贵很多,输出价格通常是输入的5倍
65%已验证Claude 3.5 Sonnet在多数基准测试中已接近甚至超越早期Claude 3 Opus的表现
65%待验证Opus 5依然擅长发现漏洞,但利用漏洞的能力被大幅削弱
60%待验证在单词学习应用项目中,Opus 5会主动检索GitHub上开源的各类词库并整合成完整词汇数据
50%待验证在未被明确要求的情况下,Opus 5在处理公告模块时主动引入了富文本编辑器组件并完成自我测试
50%待验证Opus 5在学生管理系统项目中自主选用了MyBatis-Plus框架作为后端ORM
50%待验证物流管理系统项目的提示词多达31个章节,Opus 5花了约六个小时完成
50%待验证测试采用不使用任何脚手架工具的方式,完全由Opus 5从零搭建项目基础设施
50%待验证测试者不建议贸然订阅Opus 5,原因包括封号风险较高和存在Codex等平替方案
50%待验证测试者认为Opus 5是优秀的编程模型,能力与Sonnet 5差距不大且价格更低
50%待验证Opus 5基本一次性通过了物流系统的RPC权限体系测试,但个别地方出现权限校验瑕疵
50%待验证物流管理系统集成了高德地图和百度地图,可实时显示司机车辆位置、任务线路等
50%待验证在学生管理系统测试项目中,Opus 5耗时约三到四个小时一次性完成全部开发
50%