待验证50% 置信基准精确时间
在Frontier Code编程测试上,Opus 5.5用默认档赢了Astra,单任务成本只有对手的五分之一
1
来源数
50%
置信度
中期 (~90 天)
时效性
2026/9/29
首次发现
有效期至:2026/12/28
来源
涉及实体
相关事实
待验证在 Frontier Code 上,Opus 5.5 的 medium 档(不到 1 美元/任务)得分反而高于 max 档(超过 5 美元/任务)71% 相似待验证综合四组八轮测试,Astra在前端设计、游戏复刻、3D互动三类任务上相较5.6有明显提升,5.6胜在速度快68% 相似待验证在编码测试中,Opus 5.5的中等推理档表现最强,高档和超高档会出现掉分66% 相似待验证在作者自制的代码审查基准中,Astra位居榜首,Grok 4.7紧随其后,Fable 5.1只提5条建议但质量很高65% 相似待验证Opus 5.5在token效率上不如Opus 5:Opus 5的max档每任务用73k token,Fable用78k,Opus 5.5的max档接近12万token,而GPT-6 Astra只需27k63% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/958936API
curl https://kongchang.com/api/v1/knowledge/claims/958936MCP
get_claim(id=958936)