待验证50% 置信基准精确时间
在 Deep Study 软件工程测试中,Argon 得分 77.9%,高于 GPT-6 Astra 和 Cloud Opus 5.5(后两者约为 74%)
1
来源数
50%
置信度
短期 (~14 天)
时效性
2026/10/1
首次发现
有效期至:2026/10/15
来源
涉及实体
相关事实
待验证在 Frontier Software Engineering 基准上 GPT-6 Astra 以 65.5% 领先,Opus 5.5 为 62.3%,Gemini 4 Argon 仅 55%76% 相似待验证在 DeepSWE 1.1 测试中,GPT-6.1 Sol 得 75.2%,Astra 为 74.8%,Cloud Sonnet 5.5 为 71.0%,GPT-6 Sol 最高 68.8%72% 相似待验证GPT-5.6编程能力在关键基准上达到91.9%,安全评测CyberGym得分85.6%,均超越竞品Nexus 566% 相似待验证在软件工程基准DeepSweep上GPT-6 Sol取得68.8%,距顶级旗舰约差1.1个百分点,成本降低约八成66% 相似待验证GPT-6 Astra在3D物体创建能力测试中达到95.9%的饱和度,比竞品高出10多个百分点66% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/963870API
curl https://kongchang.com/api/v1/knowledge/claims/963870MCP
get_claim(id=963870)