待验证50% 置信基准精确时间
据UP主实测,Claude Opus 5.5在编码任务上超越GPT-6 Astra,且达成同等效果的成本仅为对手约1%
1
来源数
50%
置信度
短期 (~14 天)
时效性
2026/10/1
首次发现
有效期至:2026/10/15
来源
涉及实体
相关事实
待验证Opus 5.5在token效率上不如Opus 5:Opus 5的max档每任务用73k token,Fable用78k,Opus 5.5的max档接近12万token,而GPT-6 Astra只需27k78% 相似待验证与GPT-6 Astra相比,SWE-2得分落后几个百分点,但成本仅为对方的四分之一76% 相似待验证Claude Opus 5 approaches Fable-level performance on the FrontierCode 1.1 benchmark while costing only half as much74% 相似待验证Opus 5 在 Low Effort 下的通过率约为 60%,超过了 Opus 4.8 在 Max 级别下的 59%,后者单任务成本高达 13 美元74% 相似待验证在安全对齐测试中,GPT-5.6 Sol在约48%的情况下成功利用越界目标,而GPT-6 Astra在同样测试中成功利用次数为零73% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/965292API
curl https://kongchang.com/api/v1/knowledge/claims/965292MCP
get_claim(id=965292)