[控场AI]
基准

Harbor-Index

Harbor框架提供的高质量元数据集,包含82个精心筛选的高难度评估任务,跨越29个基准测试,经过难度过滤和AI与人工双重审核,用于衡量AI Agent综合能力的高区分度评测集

时间轴 (近 90 天)

9月11日

最强配置GPT-5.5配合Codex在Harbor-Index上的通过率仅为28.0%

待验证50%
9月11日

Harbor-Index是一个包含82个精心策划的高难度任务集,跨越29个基准测试

待验证50%
9月11日

Harbor-Index的构建经历了难度过滤、AI与人工双重审核、审核-修复迭代循环等多轮筛选

待验证50%
9月11日

所有被评估的模型-harness配置在Harbor-Index上的通过率均未超过30%

待验证50%
9月11日

研究团队将所有适配器、评估结果、深度分析报告及Harbor-Index作为开源资源发布

待验证50%
9月11日

Harbor-Index在保持评估广度和挑战性的同时大幅降低了运行成本

待验证50%

全部知识事实 (6)

来源文章