Benchmark
Deep Study
一项面向AI模型的软件工程能力评测基准,用于衡量模型在复杂软件工程任务中的综合表现
Timeline (last 90 days)
Oct 1
在 Deep Study 软件工程测试中,Argon 得分 77.9%,高于 GPT-6 Astra 和 Cloud Opus 5.5(后两者约为 74%)
Unverified50%
一项面向AI模型的软件工程能力评测基准,用于衡量模型在复杂软件工程任务中的综合表现
在 Deep Study 软件工程测试中,Argon 得分 77.9%,高于 GPT-6 Astra 和 Cloud Opus 5.5(后两者约为 74%)