待验证50% 置信基准精确时间
移除歧义后所有模型准确率提升26.8至40.2个百分点,Gemini甚至达到81%,表明歧义是深度搜索代理最大性能瓶颈之一
1
来源数
50%
置信度
长期有效
时效性
2026/7/9
首次发现
来源
腾讯DiscoBench:评测LLM搜索代理歧义澄清能力的首个基准
bilibili熊二等兵2026/7/4
相关事实
待验证可变粒度搜索(Variable Granularity Search)相比束搜索和DVTS等SOTA方案,实现约3%的准确率提升,同时减少52%的计算量70% 相似待验证研究数据表明,在数学竞赛级别问题上,启用深度推理的模型准确率可从不足30%提升至80%以上68% 相似待验证GPT-4V、Gemini 等大模型在工业缺陷检测、病理切片分析等垂直领域的零样本检测精度在 mAP 指标上与专用模型存在 20-40 个百分点的差距68% 相似待验证根据LongMEM Eval基准测试,AgentMemory的检索准确率达到95.2%,比同类项目Mem0高出27个百分点66% 相似待验证美团LongCat推出Lohosearch搜索智能体基准,11个前沿模型测试中最佳得分仅34.74%,远低于人类约90%的表现66% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/387245API
curl https://kongchang.com/api/v1/knowledge/claims/387245MCP
get_claim(id=387245)