待验证50% 置信基准精确时间
在谷歌公布的图表中,Argon的Deep SWE得分接近78%,而Claude Opus 5.5和GPT-6 Astra仅略高于74%
1
来源数
50%
置信度
中期 (~90 天)
时效性
2026/10/3
首次发现
有效期至:2027/1/1
来源
涉及实体
相关事实
待验证在DeepSuite基准上Grok 4.7得71%,GPT 5.6 Sol为72.7%,Fable 5.1为70%,Astra Max以74.1%登顶73% 相似待验证在 VALS 知识任务指数上 Gemini 4 Argon 得分 68.9%,登顶 SOTA,领先 Opus 5.5 的 67%66% 相似已验证在 DeepSWE 基准上,GPT-5.6 各推理档位得分分别为 Low 45 分、Medium 61 分、High 69 分、X-High 71 分、Max 73 分66% 相似待验证Grok 4.7在Deep SWE软件工程评测拿到71.0%,TerminalBench 38.0%,在GDPVal评测以1695的Elo仅次于Fable 5.1的173565% 相似待验证在Automation Bench办公流程测试中,Gemini 4 Argon得分51.3%,GPT-6 Astra为41.4%,Claude Opus 5.5为42.5%64% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/969177API
curl https://kongchang.com/api/v1/knowledge/claims/969177MCP
get_claim(id=969177)