基准
BrowseComp-Plus
深度研究能力评估基准,用于测试AI智能体在复杂信息检索与综合分析任务上的表现,是BrowseComp的扩展版本
时间轴 (近 90 天)
10月5日
在BrowseComp-Plus基准上,CLM配合Qwen3 27B取得59.4%,比最好的摘要方案高约11%,计算量少约五分之一
待验证50%
深度研究能力评估基准,用于测试AI智能体在复杂信息检索与综合分析任务上的表现,是BrowseComp的扩展版本
在BrowseComp-Plus基准上,CLM配合Qwen3 27B取得59.4%,比最好的摘要方案高约11%,计算量少约五分之一