待验证60% 置信基准精确时间
在CursorBench 4.0基准中,Grok 4.7 Extra High得分46.3%,逼近Opus 5 Max的46.6%,成本仅6.01美元
2
来源数
60%
置信度
短期 (~14 天)
时效性
2026/9/22
首次发现
有效期至:2026/10/6
来源
涉及实体
相关事实
待验证在Terminal Bench 4.0最高精度测试中,Fable 5.1准确率为55.8%,成本为19.50美元;Astra准确率为56.7%,成本为10.35美元69% 相似待验证在Terminal-Bench 4.0上,Claude 5.1标准版得分55.8%,受信版达到60.9%;OS World 2.0部分完成率为77.9%68% 相似待验证Opus 5 在 Low Effort 下的通过率约为 60%,超过了 Opus 4.8 在 Max 级别下的 59%,后者单任务成本高达 13 美元66% 相似待验证GPT-5.6 Extreme High档位约需63美元获得53.6%得分,而Claude Sonnet自适应模式耗费约2000美元得分仅40.5%66% 相似待验证Grok 4.5在SWE Bench Pro任务上的输出Token比Opus 4.8少4.2倍66% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/941020API
curl https://kongchang.com/api/v1/knowledge/claims/941020MCP
get_claim(id=941020)