Unverified50% confidenceBenchmarkExact time
移除歧义后所有模型准确率提升26.8至40.2个百分点,Gemini甚至达到81%,表明歧义是深度搜索代理最大性能瓶颈之一
1
Sources
50%
Confidence
Long-term
Relevance
7/9/2026
First Seen
Sources
腾讯DiscoBench:评测LLM搜索代理歧义澄清能力的首个基准
bilibili熊二等兵7/4/2026
Related Claims
Unverified可变粒度搜索(Variable Granularity Search)相比束搜索和DVTS等SOTA方案,实现约3%的准确率提升,同时减少52%的计算量70% similarUnverified研究数据表明,在数学竞赛级别问题上,启用深度推理的模型准确率可从不足30%提升至80%以上68% similarUnverifiedGPT-4V、Gemini 等大模型在工业缺陷检测、病理切片分析等垂直领域的零样本检测精度在 mAP 指标上与专用模型存在 20-40 个百分点的差距68% similarUnverified根据LongMEM Eval基准测试,AgentMemory的检索准确率达到95.2%,比同类项目Mem0高出27个百分点66% similarUnverified美团LongCat推出Lohosearch搜索智能体基准,11个前沿模型测试中最佳得分仅34.74%,远低于人类约90%的表现66% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/387245API
curl https://kongchang.com/api/v1/knowledge/claims/387245MCP
get_claim(id=387245)