Unverified50% confidenceFactExact time
现有基准GAIA、BrowseComp只提供明确查询,仅考验多步推理能力,未考虑歧义问题
1
Sources
50%
Confidence
Long-term
Relevance
7/9/2026
First Seen
Sources
腾讯DiscoBench:评测LLM搜索代理歧义澄清能力的首个基准
bilibili熊二等兵7/4/2026
Related Claims
UnverifiedSkillSpector支持两种检测模式:不需要模型的本地规则静态扫描,以及接入大模型的深度语义分析65% similarUnverified基于规则/启发式的检查是最轻量的评估方式,快速低成本可实时运行,但只能捕捉表层问题64% similarUnverified在关键路径上引入校验和、断言、冗余计算等校验机制能够尽早发现异常并保留排查线索64% similarUnverified去中心化推理的可验证性方案包括乐观验证、零知识证明推理(zkML)和可信执行环境(TEE),但尚无完美解决方案63% similarUnverifiedGAIA由Meta提出,专门评测Agent的真实世界问答和工具使用能力,要求通过多步骤搜索、计算和推理得出答案63% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/396703API
curl https://kongchang.com/api/v1/knowledge/claims/396703MCP
get_claim(id=396703)