[KongchangAI]
Benchmark

Deep Study

一项面向AI模型的软件工程能力评测基准,用于衡量模型在复杂软件工程任务中的综合表现

Timeline (last 90 days)

Oct 1

在 Deep Study 软件工程测试中,Argon 得分 77.9%,高于 GPT-6 Astra 和 Cloud Opus 5.5(后两者约为 74%)

Unverified50%

All Facts (1)

Source Articles