待验证50% 置信基准精确时间
Reddit社区的大规模基准测试基于BeeLlama.cpp v0.4.0,在Qwen 3.6 27B和Gemma 4 31B两款模型上累计跑了413组配置对比,其中Qwen模型238组、Gemma模型175组
1
来源数
50%
置信度
中期 (~90 天)
时效性
2026/8/8
首次发现
有效期至:2026/11/6
来源
相关事实
待验证Qwen2.5-Coder 系列由阿里巴巴通义实验室出品,其32B参数版本在多项指标上超越了GPT-4o71% 相似待验证Qwen2.5-72B 在多项基准测试中接近 Llama-3.1-405B 的表现71% 相似待验证Qwen3.6-27B各项基准测试成绩在同规模(20B-30B参数级别)模型中处于领先地位67% 相似待验证Qwen3.6-27B在多个基准测试维度上全面超越了前代Qwen系列中参数量更大的旗舰模型67% 相似待验证在六种排序算法可视化HTML生成的复杂任务测试中,Gemini 3.1和Qwen 3.5 400B成功完成,而QwenCoder 80B本地版本失败67% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/707990API
curl https://kongchang.com/api/v1/knowledge/claims/707990MCP
get_claim(id=707990)