Unverified50% confidenceBenchmarkExact time
MiniMax M2.7每任务提问0.6个问题,但澄清推进率只有60.7%,存在低信息增益提问问题
1
Sources
50%
Confidence
Medium-term (~90 days)
Relevance
7/9/2026
First Seen
Valid until: 10/7/2026
Sources
腾讯DiscoBench:评测LLM搜索代理歧义澄清能力的首个基准
bilibili熊二等兵7/4/2026
Related Claims
UnverifiedMiniMax M3 在7个高难度任务测试中获得平均58.3分75% similarUnverifiedMiniMax M3 received an average score of 58.3 across 7 high-difficulty coding tasks in a systematic evaluation72% similarUnverifiedQwen 3.6 Max中性模式下歧义检测F1仅16%,平均每任务只问0.07个问题,但一旦提问澄清准确率高达94.7%71% similarUnverifiedMiniMax M3 在拖拽看板测试中得分60分,拖拽逻辑完整但缺乏国际化支持和响应式设计67% similarUnverifiedMiniMax M2.7在SWE-Pro基准测试上得分56.22%66% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/387233API
curl https://kongchang.com/api/v1/knowledge/claims/387233MCP
get_claim(id=387233)