[控场AI]
基准

SciCode

用于评估大语言模型科学计算代码生成能力的基准测试集,考察模型在科学计算场景下编写正确代码的能力

时间轴 (近 90 天)

9月16日

豆包2.1 Pro在科学计算代码评测SciCode中得到59.8分

待验证50%

全部知识事实 (1)

来源文章