Unverified50% confidenceBenchmarkExact time
在Terminal Bench上Beam约81分垫底,低于DeepSeek 90.6、Kimi 88.3、GLM 88.2、Qwen 86.6
1
Sources
50%
Confidence
Short-term (~14 days)
Relevance
10/8/2026
First Seen
Valid until: 10/22/2026
Sources
Related Entities
Related Claims
Unverified在SWE Bench Pro上Glimmer以51.2略胜Qwen的50.2,但在SWE Bench Verified(Qwen 77.2 vs 76)和Terminal Bench(Qwen 60.7 vs 51.7)上Qwen反超66% similarUnverified在终端基准(Terminal Bench)测试中,Qwen 3.6 27B得分约60.7,而Muse Glimmer只有51.7,明显落后64% similarUnverified阿里官方给出Qwen3.8 Flash的SWE-Bench Pro得62.5,领先Claude Opus 4.6约9分;Cowork Bench 73.9,DeepSeek为45.1;Job Bench 55.7,超出Opus 4.6约20分64% similarUnverified同一个DeepSeek v1.1模型在Terminal Bench 2.0上不同Harness下的得分从69.8%跨到74.2%61% similarUnverified在Live Code Bench上,Qwen3.8-27B得分90.3,Claude Opus 4.6得分88.861% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/987291API
curl https://kongchang.com/api/v1/knowledge/claims/987291MCP
get_claim(id=987291)