基准
BrowseComp
BrowseComp是一个用于评估AI智能体网络浏览与信息检索能力的基准测试集。它通过设计需要多步骤网络搜索才能解答的复杂问题,衡量模型在真实网络环境中定位、筛选和整合信息的能力。该基准注重问题的客观可验证性,旨在区分具备深度搜索推理能力与仅依赖表层检索的AI系统。
时间轴 (近 90 天)
5月31日
BrowseComp是OpenAI发布的网页浏览与信息检索能力基准测试
待验证60%
来源文章
OpenAI发布GPT-5.6与ChatGPT Work:AI自主工作时代来临7月24日OpenAI GPT-Live:全双工语音AI的交互革命7月20日OpenAI GPT-Live语音模型:全双工交互如何重塑人机对话7月12日OpenAI GPT Live:全双工语音AI,边听边说边执行任务7月12日GPT-5.6发布:Sol/Terra/Luna三模型重塑AI编程与办公自动化7月11日GPT-5.6深度实测:ChatGPT与Codex合体,Sol模型能力全解析7月11日GPT-5.6全面开放:Sol/Terra/Luna三档模型与四智能体并行深度解析7月11日Gemini 3.1 Pro深度横评:ARC-AGI-2得分77.1%,真的最强吗?5月23日