待验证85% 置信事实时间未知
QwQ-32B在多项主流基准测试中与DeepSeek R1满血版表现几乎持平,部分任务上实现了反超
1
来源数
85%
置信度
中期 (~90 天)
时效性
2026/6/1
首次发现
有效期至:2026/8/30
来源
阿里QwQ-32B开源:32B参数如何媲美671B的DeepSeek R1
bilibiliAI大模型全栈
涉及实体
相关事实
待验证基准测试显示Qwen3-235B的表现追平甚至超越了DeepSeek R1,在数学、编码、推理等类别中均占优势77% 相似待验证在LiveBench等代码相关任务上,QwQ-32B超过DeepSeek R1约两个百分点76% 相似待验证Qwen2.5-72B 在多项基准测试中接近 Llama-3.1-405B 的表现68% 相似待验证Qwen3.6-27B各项基准测试成绩在同规模(20B-30B参数级别)模型中处于领先地位66% 相似待验证Reddit社区的大规模基准测试基于BeeLlama.cpp v0.4.0,在Qwen 3.6 27B和Gemma 4 31B两款模型上累计跑了413组配置对比,其中Qwen模型238组、Gemma模型175组66% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/23192API
curl https://kongchang.com/api/v1/knowledge/claims/23192MCP
get_claim(id=23192)