Unverified50% confidenceBenchmarkExact time
Qwen 3.6 Max中性模式下歧义检测F1仅16%,平均每任务只问0.07个问题,但一旦提问澄清准确率高达94.7%
1
Sources
50%
Confidence
Medium-term (~90 days)
Relevance
7/9/2026
First Seen
Valid until: 10/7/2026
Sources
腾讯DiscoBench:评测LLM搜索代理歧义澄清能力的首个基准
bilibili熊二等兵7/4/2026
Related Claims
UnverifiedMiniMax M2.7每任务提问0.6个问题,但澄清推进率只有60.7%,存在低信息增益提问问题71% similarUnverifiedQwen 3.6 Max在中性模式下端到端准确率仅12.3%69% similarUnverifiedQwen3.7 Max的输出质量高度依赖提示词质量,同一模型在不同提示词下的性能差异可高达30%-50%68% similarUnverified引导模式下平均端到端准确率从28.6%提升到33.7%,歧义检测F1值从45.3%提升到64.9%68% similarUnverifiedQwen3.6 27B版本在Simple QA测试中达到95.7%的准确率68% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/387230API
curl https://kongchang.com/api/v1/knowledge/claims/387230MCP
get_claim(id=387230)