Unverified50% confidenceBenchmarkExact time
在 GPQA-Diamond xhigh 测试中,基座 Qwen3.8-27B 达 88.4% 准确率消耗 6,642 中位 token,Swift 保持 88.3% 准确率但 token 降至 2,771
1
Sources
50%
Confidence
Medium-term (~90 days)
Relevance
9/14/2026
First Seen
Valid until: 12/13/2026
Sources
Related Entities
Related Claims
Unverified微调后的Qwen3.5-4B模型在BU Bench V1基准上准确率从15%提升至53%72% similarUnverifiedQwen 3.6 Max在中性模式下端到端准确率仅12.3%69% similarUnverifiedQwen3.8-27B在Terminal Bench、GPQA Diamond、HLE测试中均落后于Claude Opus 4.6(分别为73 vs 78.2、89.2 vs 91.3、30.8 vs 40)69% similarUnverified在终端基准(Terminal Bench)测试中,Qwen 3.6 27B得分约60.7,而Muse Glimmer只有51.7,明显落后69% similarUnverified表现最佳的Edu-QuRater在还原留出集的GPT-4.1-mini成对判断时平均准确率达到0.91768% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/920997API
curl https://kongchang.com/api/v1/knowledge/claims/920997MCP
get_claim(id=920997)