待验证50% 置信基准精确时间
MiniMax M2.7每任务提问0.6个问题,但澄清推进率只有60.7%,存在低信息增益提问问题
1
来源数
50%
置信度
中期 (~90 天)
时效性
2026/7/9
首次发现
有效期至:2026/10/7
来源
腾讯DiscoBench:评测LLM搜索代理歧义澄清能力的首个基准
bilibili熊二等兵2026/7/4
相关事实
待验证MiniMax M3 在7个高难度任务测试中获得平均58.3分75% 相似待验证MiniMax M3 received an average score of 58.3 across 7 high-difficulty coding tasks in a systematic evaluation72% 相似待验证Qwen 3.6 Max中性模式下歧义检测F1仅16%,平均每任务只问0.07个问题,但一旦提问澄清准确率高达94.7%71% 相似待验证MiniMax M3 在拖拽看板测试中得分60分,拖拽逻辑完整但缺乏国际化支持和响应式设计67% 相似待验证MiniMax M2.7在SWE-Pro基准测试上得分56.22%66% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/387233API
curl https://kongchang.com/api/v1/knowledge/claims/387233MCP
get_claim(id=387233)