基准
Harbor-Index
Harbor框架提供的高质量元数据集,包含82个精心筛选的高难度评估任务,跨越29个基准测试,经过难度过滤和AI与人工双重审核,用于衡量AI Agent综合能力的高区分度评测集
时间轴 (近 90 天)
9月11日
最强配置GPT-5.5配合Codex在Harbor-Index上的通过率仅为28.0%
待验证50%
9月11日
Harbor-Index是一个包含82个精心策划的高难度任务集,跨越29个基准测试
待验证50%
9月11日
Harbor-Index的构建经历了难度过滤、AI与人工双重审核、审核-修复迭代循环等多轮筛选
待验证50%
9月11日
所有被评估的模型-harness配置在Harbor-Index上的通过率均未超过30%
待验证50%
9月11日
研究团队将所有适配器、评估结果、深度分析报告及Harbor-Index作为开源资源发布
待验证50%
9月11日
Harbor-Index在保持评估广度和挑战性的同时大幅降低了运行成本
待验证50%