待验证50% 置信基准精确时间
在Terminal Bench上Beam约81分垫底,低于DeepSeek 90.6、Kimi 88.3、GLM 88.2、Qwen 86.6
1
来源数
50%
置信度
短期 (~14 天)
时效性
2026/10/8
首次发现
有效期至:2026/10/22
来源
涉及实体
相关事实
待验证在SWE Bench Pro上Glimmer以51.2略胜Qwen的50.2,但在SWE Bench Verified(Qwen 77.2 vs 76)和Terminal Bench(Qwen 60.7 vs 51.7)上Qwen反超66% 相似待验证在终端基准(Terminal Bench)测试中,Qwen 3.6 27B得分约60.7,而Muse Glimmer只有51.7,明显落后64% 相似待验证阿里官方给出Qwen3.8 Flash的SWE-Bench Pro得62.5,领先Claude Opus 4.6约9分;Cowork Bench 73.9,DeepSeek为45.1;Job Bench 55.7,超出Opus 4.6约20分64% 相似待验证同一个DeepSeek v1.1模型在Terminal Bench 2.0上不同Harness下的得分从69.8%跨到74.2%61% 相似待验证在Live Code Bench上,Qwen3.8-27B得分90.3,Claude Opus 4.6得分88.861% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/987291API
curl https://kongchang.com/api/v1/knowledge/claims/987291MCP
get_claim(id=987291)