待验证50% 置信基准精确时间
GPT-6 Astra在Frontier Math Tier 4上峰值达到98%,在不开启推理、不使用思维链的情况下仍达到83%
1
来源数
50%
置信度
中期 (~90 天)
时效性
2026/10/4
首次发现
有效期至:2027/1/2
来源
涉及实体
相关事实
待验证在DeepSuite基准上Grok 4.7得71%,GPT 5.6 Sol为72.7%,Fable 5.1为70%,Astra Max以74.1%登顶76% 相似待验证在Terminal Bench 2.1基准测试上,GPT-5.6 Sol的Ultra模式接近92%,超越竞品的88%表现75% 相似待验证在超高推理强度下 GPT-6.1 Sol 事实错误率为 4.1%,低于上一代的 4.5%,接近 Astra 的 4.0%75% 相似待验证在SWE-Bench Pro编程评测上,Claude Fable 5以80%的成绩领先GPT-5.6 Sol的64.6%73% 相似待验证四轮测试中Astra拿下三胜、动态图形打平,测评者判定GPT-6整体领先72% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/972624API
curl https://kongchang.com/api/v1/knowledge/claims/972624MCP
get_claim(id=972624)