待验证50% 置信基准精确时间
在Frontier Code基准等长周期编程任务上,Opus 5.5可能略胜Astra
1
来源数
50%
置信度
短期 (~14 天)
时效性
2026/10/4
首次发现
有效期至:2026/10/18
来源
涉及实体
相关事实
待验证在Frontier Code编程测试上,Opus 5.5用默认档赢了Astra,单任务成本只有对手的五分之一75% 相似待验证在该次OZ世界还原测试中,Astra整体观感最佳,Opus 5.5细节最多,Sol 6.1表现明显掉队68% 相似待验证Opus 5.5在token效率上不如Opus 5:Opus 5的max档每任务用73k token,Fable用78k,Opus 5.5的max档接近12万token,而GPT-6 Astra只需27k66% 相似待验证一位Twitter用户表示更喜欢Opus 5.5多过Astra,但更喜欢Codex应用多过Claude应用65% 相似待验证在深度代码审查任务上Grok 4.7和Sol表现优于Opus和Fable,但Opus从5到5.5在该bench上的提升接近翻倍65% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/972607API
curl https://kongchang.com/api/v1/knowledge/claims/972607MCP
get_claim(id=972607)