[控场AI]
基准

BrowseComp

BrowseComp是一个用于评估AI智能体网络浏览与信息检索能力的基准测试集。它通过设计需要多步骤网络搜索才能解答的复杂问题,衡量模型在真实网络环境中定位、筛选和整合信息的能力。该基准注重问题的客观可验证性,旨在区分具备深度搜索推理能力与仅依赖表层检索的AI系统。

时间轴 (近 90 天)

5月31日

BrowseComp是OpenAI发布的网页浏览与信息检索能力基准测试

待验证60%

来源文章