待验证50% 置信基准精确时间
在 GPQA-Diamond xhigh 测试中,基座 Qwen3.8-27B 达 88.4% 准确率消耗 6,642 中位 token,Swift 保持 88.3% 准确率但 token 降至 2,771
1
来源数
50%
置信度
中期 (~90 天)
时效性
2026/9/14
首次发现
有效期至:2026/12/13
来源
涉及实体
相关事实
待验证微调后的Qwen3.5-4B模型在BU Bench V1基准上准确率从15%提升至53%72% 相似待验证Qwen 3.6 Max在中性模式下端到端准确率仅12.3%69% 相似待验证Qwen3.8-27B在Terminal Bench、GPQA Diamond、HLE测试中均落后于Claude Opus 4.6(分别为73 vs 78.2、89.2 vs 91.3、30.8 vs 40)69% 相似待验证在终端基准(Terminal Bench)测试中,Qwen 3.6 27B得分约60.7,而Muse Glimmer只有51.7,明显落后69% 相似待验证表现最佳的Edu-QuRater在还原留出集的GPT-4.1-mini成对判断时平均准确率达到0.91768% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/920997API
curl https://kongchang.com/api/v1/knowledge/claims/920997MCP
get_claim(id=920997)