[控场AI]
基准

AIRS-Bench

面向自主AI研究任务的基准测试集,包含多项自主AI研究能力评估任务

时间轴 (近 90 天)

9月23日

AIBuildAI-2.5在来自AIRS-Bench的六项自主AI研究任务上的表现超越了一个强劲的基线系统

待验证50%
9月23日

AIRS-Bench侧重于开放的自主AI研究场景,要求智能体在给定研究目标后自主完成文献调研、方案设计与实验验证的完整闭环

待验证50%

全部知识事实 (2)

来源文章