待验证90% 置信事实时间未知
千问3.6 Plus综合得分69.0分,排名末位被淘汰出局
1
来源数
90%
置信度
中期 (~90 天)
时效性
2026/5/31
首次发现
有效期至:2026/8/29
来源
7个AI修同一个Bug实测:GLM 5.1反超Claude Sonnet详细对比
bilibili寒冰巨魔9527
涉及实体
相关事实
待验证Luna后端得分53.74分,前端得分7.32分,前端交互基本不可用73% 相似待验证通义千问3.6在SWE-Bench测试中得分78.8分,对比Claude Opus的80.9分67% 相似待验证Ornith 9B 在 SWE-Bench 上得分 69.4,接近千问 3.5-35B 的 70 分64% 相似待验证Qwen 3 Max综合八项测试获得65分,得分率81.25%,在测评者排行榜上位居第二,仅次于得分82.5%的Claude旗舰63% 相似待验证在终端基准(Terminal Bench)测试中,Qwen 3.6 27B得分约60.7,而Muse Glimmer只有51.7,明显落后62% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/13178API
curl https://kongchang.com/api/v1/knowledge/claims/13178MCP
get_claim(id=13178)