[控场AI]
模型千问3 / 千问三

Qwen3

阿里巴巴推出的第五代千问大模型系列,全球首款开源混合推理模型,共六个尺寸,支持Dense和MoE双架构,旗舰模型235B-A22B可与Gemini 2.5 Pro正面抗衡

核心事实

时间轴 (近 90 天)

9月12日

Qwen3系列训练数据据称超过36万亿token,覆盖代码、数学、科学和多语言文本

待验证50%
9月12日

开发者声称Ox Alpha在同类任务上的表现比Qwen3系列和Anthropic的Opus 4.5好上1000倍

待验证50%
9月12日

对于单卡运行Qwen3的场景,SXM2与PCIe版本性能差异不明显,PCIe版本部署门槛更低

待验证50%
9月12日

在策略蒸馏出自DAGGER相关论文,可视为将教师评估纳入闭环的迭代式SFT,在GLM-4.5、Qwen3和DeepSeek中都有应用

待验证50%
9月12日

Qwen3的训练后期大量使用了基于结果奖励的强化学习

待验证50%
9月12日

Qwen3训练后期单个任务的完成需要耗费数天时间

待验证50%
9月12日

Qwen3训练团队采用渐进式训练策略:先完成简单任务,然后扩大规模、引入多任务、再逐步增加任务难度

待验证50%
9月12日

Qwen3 27B模型可以在配置不错的笔记本电脑上本地运行,无需依赖云端API或数据中心

待验证50%
9月12日

Qwen3的架构与前一代版本几乎完全相同,性能提升并非来自架构革新

待验证50%
9月12日

在部分测试中Qwen3中型版本面对当前前沿模型能站稳脚跟,与一年前耗资数十亿美元的系统相比表现更胜一筹

待验证50%

还有 38 条时间轴事件

全部知识事实 (20)

已验证

Qwen2.5:7B模型Q4量化后文件大小约为4GB

80%
已验证

Qwen(通义千问)是阿里巴巴达摩院开源的系列大模型,覆盖从0.5B到72B的多种参数规模,支持多语言和多模态任务

80%
已验证

Qwen3引入了思考模式与非思考模式的动态切换机制

75%
已验证

Qwen系列采用Apache 2.0协议开放,允许商业使用和二次修改

65%
已验证

Qwen 3.5架构使用改进的Transformer变体,融合了分组查询注意力(GQA)和旋转位置编码(RoPE)等技术

65%
已验证

Qwen3.6在训练时加入了MTP头,模型本身具备一次预测多个未来token的能力

65%
已验证

Qwen 2.5系列在2024年推出,覆盖0.5B至72B的全系列开源权重

65%
待验证

Qwen3.6 35B模型原生支持MTP,与oMLX结合可直接激活加速能力,无需额外配置独立的草稿模型

85%
部分验证

通过更高质量的训练数据、更优化的训练策略和更精细的后训练对齐,较小规模的模型可以在实际任务上完全超越规模更大但训练质量较低的模型

70%
待验证

在24GB显存的显卡上运行Qwen3.6 27B模型,未经优化可达每秒约40个Token的生成速度,优化后可达50-60 Token/s

60%
待验证

Qwen3系列训练数据据称超过36万亿token,覆盖代码、数学、科学和多语言文本

50%
待验证

开发者声称Ox Alpha在同类任务上的表现比Qwen3系列和Anthropic的Opus 4.5好上1000倍

50%
待验证

对于单卡运行Qwen3的场景,SXM2与PCIe版本性能差异不明显,PCIe版本部署门槛更低

50%
待验证

在策略蒸馏出自DAGGER相关论文,可视为将教师评估纳入闭环的迭代式SFT,在GLM-4.5、Qwen3和DeepSeek中都有应用

50%
待验证

Qwen3训练团队采用渐进式训练策略:先完成简单任务,然后扩大规模、引入多任务、再逐步增加任务难度

50%
待验证

Qwen3的训练后期大量使用了基于结果奖励的强化学习

50%
待验证

Ollama、LM Studio等工具让普通用户无需编程基础即可在个人电脑上运行Qwen3

50%
待验证

在部分测试中Qwen3中型版本面对当前前沿模型能站稳脚跟,与一年前耗资数十亿美元的系统相比表现更胜一筹

50%
待验证

Qwen3 27B模型可以在配置不错的笔记本电脑上本地运行,无需依赖云端API或数据中心

50%
待验证

Qwen3训练后期单个任务的完成需要耗费数天时间

50%

来源文章