基准
AIRS-Bench
面向自主AI研究任务的基准测试集,包含多项自主AI研究能力评估任务
时间轴 (近 90 天)
9月23日
AIBuildAI-2.5在来自AIRS-Bench的六项自主AI研究任务上的表现超越了一个强劲的基线系统
待验证50%
9月23日
AIRS-Bench侧重于开放的自主AI研究场景,要求智能体在给定研究目标后自主完成文献调研、方案设计与实验验证的完整闭环
待验证50%
面向自主AI研究任务的基准测试集,包含多项自主AI研究能力评估任务
AIBuildAI-2.5在来自AIRS-Bench的六项自主AI研究任务上的表现超越了一个强劲的基线系统
AIRS-Bench侧重于开放的自主AI研究场景,要求智能体在给定研究目标后自主完成文献调研、方案设计与实验验证的完整闭环