待验证90% 置信事实时间未知
Anthropic在API中引入了effort参数,中等effort可匹配Sonnet 4.5的最佳SWE-Bench分数同时减少76%的输出token
1
来源数
90%
置信度
中期 (~90 天)
时效性
2026/5/31
首次发现
有效期至:2026/8/29
来源
Claude Opus 4.5工程测试碾压人类:AI编程能力全面超越顶尖工程师
bilibili枫叶边城
涉及实体
相关事实
待验证Anthropic表示Sonnet 4.6在提示注入抵抗能力方面的表现与Opus 4.6相当74% 相似待验证最大effort设置下Opus 4.5超越Sonnet 4.5达4.3个百分点,同时仍减少48%的token73% 相似待验证Sonnet 5 的 Max Effort 模式相比 Sonnet 4.6,每个 Intelligence Index 任务的输出 Token 多约 40%73% 相似待验证实测者建议对于绝大多数任务继续使用Opus 4.8以获得更好效果,认为Sonnet 5令人失望72% 相似待验证在SWE Bench Pro编程基准测试中,Sonnet 5取得63.2%,Opus 4.8取得69.2%70% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/13802API
curl https://kongchang.com/api/v1/knowledge/claims/13802MCP
get_claim(id=13802)