[控场AI]
基准

Deep Study

一项面向AI模型的软件工程能力评测基准,用于衡量模型在复杂软件工程任务中的综合表现

时间轴 (近 90 天)

10月1日

在 Deep Study 软件工程测试中,Argon 得分 77.9%,高于 GPT-6 Astra 和 Cloud Opus 5.5(后两者约为 74%)

待验证50%

全部知识事实 (1)

来源文章