部分验证65% 置信基准精确时间
Opus 5.5在终端智能体基准拿到66分,高于Sonnet的55分和Astra的57.9分
3
来源数
65%
置信度
中期 (~90 天)
时效性
2026/9/29
首次发现
有效期至:2026/12/28
来源
涉及实体
相关事实
已验证Sonnet 5 的 Intelligence Index 比 Sonnet 4.6 高出 6 分,在代理知识工作任务上超过了 Opus 4.880% 相似已验证在 Terminal Bench 4.0 上,Opus 5.5 得分 66.4%,Astra 为 57.9%,Fable 5.1 为 55.8%,前代 Opus 5 为 52.3%79% 相似已验证Claude Sonnet 5 在 SWE-bench Verified(Agentic Coding)上得分 63.22%,距 Opus 4.8 约差 6 个百分点78% 相似待验证在 Cursor Bench 上,Sonnet 5.5 的最好成绩与 Opus 5.5 只差两分左右74% 相似待验证Opus 5.5在token效率上不如Opus 5:Opus 5的max档每任务用73k token,Fable用78k,Opus 5.5的max档接近12万token,而GPT-6 Astra只需27k73% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/958712API
curl https://kongchang.com/api/v1/knowledge/claims/958712MCP
get_claim(id=958712)