Claude Opus 5
Anthropic即将发布的旗舰模型,能力接近上一代旗舰水平,但推理成本显著降低,预计发布时间为2025年7月
Core Facts
Timeline (last 90 days)
在BrowseComp智能体搜索基准上模型得分30.8%,与GPT系列基本持平
在Automation Bench自动化基准上Claude Opus 5拿到约25%通过率,其他模型普遍聚集在15%左右
博主判断该代模型不是断层式智力跃升,而是在同等或更好效果下大幅降低成本
在GDPval知识工作基准上模型得分1861,高于人类平均水平
在ARC-AGI-3新颖问题解决基准上模型得分30.2%,而上一代仅1.5%
Theo认为Claude Opus 5可能是唯一需要的编码模型,成为其日常编码首选
Theo实测发现一整天重度工作只消耗周额度的12%,而同样强度用Fable一天能烧掉一个半周的额度
Opus 5擅长发现漏洞但利用漏洞的能力被大幅削弱,属于内化式对齐
Anthropic称Opus 5是迄今最对齐的模型,遵守宪法的程度超过4.8、Sonnet 5和Fable,欺骗行为率最低
折算真实使用场景,Opus 5相对Fable的实际成本优势约为20%到25%,Fable单任务约2.75美元,Opus 5约2.03美元
40 more timeline events
All Facts (20)
Claude Opus 5是Anthropic于2025年发布的旗舰级大语言模型,代表Claude系列最高能力层级
90%VerifiedAnthropic称Opus 5是迄今最对齐的模型,遵守宪法程度超过Sonnet 5和Fable,欺骗行为率最低
85%VerifiedClaude Opus 4.7的定价为输入$5.00/百万token,输出$25.00/百万token
80%VerifiedClaude Opus 4.8's price is unchanged compared to Claude Opus 4.7
70%Verified本次对 Claude Opus 4.8 的多场景深度测试总计花费约 50 美元 Token 费用
70%VerifiedClaude 3.5 Sonnet在多数基准测试中已接近甚至超越早期Claude 3 Opus的表现
65%UnverifiedClaude Opus 5 approaches Fable-level performance on the FrontierCode 1.1 benchmark while costing only half as much
80%Unverified任何大模型的输出Token都比输入Token贵很多,输出价格通常是输入的5倍
65%UnverifiedOpus 5依然擅长发现漏洞,但利用漏洞的能力被大幅削弱
60%Unverified在Automation Bench自动化基准上Claude Opus 5拿到约25%通过率,其他模型普遍聚集在15%左右
50%Unverified博主判断该代模型不是断层式智力跃升,而是在同等或更好效果下大幅降低成本
50%Unverified在BrowseComp智能体搜索基准上模型得分30.8%,与GPT系列基本持平
50%Unverified在GDPval知识工作基准上模型得分1861,高于人类平均水平
50%Unverified在ARC-AGI-3新颖问题解决基准上模型得分30.2%,而上一代仅1.5%
50%UnverifiedTheo认为Claude Opus 5可能是唯一需要的编码模型,成为其日常编码首选
50%UnverifiedAnthropic称Opus 5是迄今最对齐的模型,遵守宪法的程度超过4.8、Sonnet 5和Fable,欺骗行为率最低
50%UnverifiedOpus 5擅长发现漏洞但利用漏洞的能力被大幅削弱,属于内化式对齐
50%Unverified折算真实使用场景,Opus 5相对Fable的实际成本优势约为20%到25%,Fable单任务约2.75美元,Opus 5约2.03美元
50%UnverifiedTheo实测发现一整天重度工作只消耗周额度的12%,而同样强度用Fable一天能烧掉一个半周的额度
50%UnverifiedClaude Opus 5的API定价与上一代Opus 4.8完全相同
50%