待验证50% 置信基准精确时间
在 Frontier Software Engineering 基准上 GPT-6 Astra 以 65.5% 领先,Opus 5.5 为 62.3%,Gemini 4 Argon 仅 55%
1
来源数
50%
置信度
短期 (~14 天)
时效性
2026/10/1
首次发现
有效期至:2026/10/15
来源
涉及实体
相关事实
待验证在 Deep Study 软件工程测试中,Argon 得分 77.9%,高于 GPT-6 Astra 和 Cloud Opus 5.5(后两者约为 74%)76% 相似待验证GPT-5.6编程能力在关键基准上达到91.9%,安全评测CyberGym得分85.6%,均超越竞品Nexus 575% 相似待验证在 DeepSWE 1.1 测试中,GPT-6.1 Sol 得 75.2%,Astra 为 74.8%,Cloud Sonnet 5.5 为 71.0%,GPT-6 Sol 最高 68.8%74% 相似待验证GPT-5.6 Sol在OSWorld 2.0计算机操作基准上达到62.6%,超越Opus 4.8,同时输出Token减少85%73% 相似待验证在企业平台Ramp上,GPT-6 Astra占据约13%的企业AI支出,而Claude/Fable仅占8%73% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/963832API
curl https://kongchang.com/api/v1/knowledge/claims/963832MCP
get_claim(id=963832)