Unverified50% confidenceBenchmarkExact time
在BrowseComp智能体搜索基准上模型得分30.8%,与GPT系列基本持平
1
Sources
50%
Confidence
Short-term (~14 days)
Relevance
8/23/2026
First Seen
Valid until: 9/6/2026
Sources
Related Entities
Related Claims
Verified即使是GPT-4这类顶级模型,在特定领域的幻觉率仍可达到15%-30%76% similarUnverifiedGPT-5.6 Pro版本中有30多种模型和推理档位的组合可选74% similarUnverified在DeepSWE基准测试中,GPT 5.5以约70%的通过率高居榜首,比Opus 4.7领先超过15个百分点73% similarUnverifiedGPT-4 发布时在 MATH 数据集上的正确率为 42.5%71% similarUnverified评测采用 GPT-5.5 担任 LLM 评审,并以 70% 人工 + 30% 机器权重合成加权指数70% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/791487API
curl https://kongchang.com/api/v1/knowledge/claims/791487MCP
get_claim(id=791487)