Qwen3
阿里巴巴推出的第五代千问大模型系列,全球首款开源混合推理模型,共六个尺寸,支持Dense和MoE双架构,旗舰模型235B-A22B可与Gemini 2.5 Pro正面抗衡
核心事实
时间轴 (近 90 天)
Qwen3系列训练数据据称超过36万亿token,覆盖代码、数学、科学和多语言文本
开发者声称Ox Alpha在同类任务上的表现比Qwen3系列和Anthropic的Opus 4.5好上1000倍
对于单卡运行Qwen3的场景,SXM2与PCIe版本性能差异不明显,PCIe版本部署门槛更低
在策略蒸馏出自DAGGER相关论文,可视为将教师评估纳入闭环的迭代式SFT,在GLM-4.5、Qwen3和DeepSeek中都有应用
Qwen3的训练后期大量使用了基于结果奖励的强化学习
Qwen3训练后期单个任务的完成需要耗费数天时间
Qwen3训练团队采用渐进式训练策略:先完成简单任务,然后扩大规模、引入多任务、再逐步增加任务难度
Qwen3 27B模型可以在配置不错的笔记本电脑上本地运行,无需依赖云端API或数据中心
Qwen3的架构与前一代版本几乎完全相同,性能提升并非来自架构革新
在部分测试中Qwen3中型版本面对当前前沿模型能站稳脚跟,与一年前耗资数十亿美元的系统相比表现更胜一筹
还有 38 条时间轴事件
全部知识事实 (20)
Qwen2.5:7B模型Q4量化后文件大小约为4GB
80%已验证Qwen(通义千问)是阿里巴巴达摩院开源的系列大模型,覆盖从0.5B到72B的多种参数规模,支持多语言和多模态任务
80%已验证Qwen3引入了思考模式与非思考模式的动态切换机制
75%已验证Qwen系列采用Apache 2.0协议开放,允许商业使用和二次修改
65%已验证Qwen 3.5架构使用改进的Transformer变体,融合了分组查询注意力(GQA)和旋转位置编码(RoPE)等技术
65%已验证Qwen3.6在训练时加入了MTP头,模型本身具备一次预测多个未来token的能力
65%已验证Qwen 2.5系列在2024年推出,覆盖0.5B至72B的全系列开源权重
65%待验证Qwen3.6 35B模型原生支持MTP,与oMLX结合可直接激活加速能力,无需额外配置独立的草稿模型
85%部分验证通过更高质量的训练数据、更优化的训练策略和更精细的后训练对齐,较小规模的模型可以在实际任务上完全超越规模更大但训练质量较低的模型
70%待验证在24GB显存的显卡上运行Qwen3.6 27B模型,未经优化可达每秒约40个Token的生成速度,优化后可达50-60 Token/s
60%待验证Qwen3系列训练数据据称超过36万亿token,覆盖代码、数学、科学和多语言文本
50%待验证开发者声称Ox Alpha在同类任务上的表现比Qwen3系列和Anthropic的Opus 4.5好上1000倍
50%待验证对于单卡运行Qwen3的场景,SXM2与PCIe版本性能差异不明显,PCIe版本部署门槛更低
50%待验证在策略蒸馏出自DAGGER相关论文,可视为将教师评估纳入闭环的迭代式SFT,在GLM-4.5、Qwen3和DeepSeek中都有应用
50%待验证Qwen3训练团队采用渐进式训练策略:先完成简单任务,然后扩大规模、引入多任务、再逐步增加任务难度
50%待验证Qwen3的训练后期大量使用了基于结果奖励的强化学习
50%待验证Ollama、LM Studio等工具让普通用户无需编程基础即可在个人电脑上运行Qwen3
50%待验证在部分测试中Qwen3中型版本面对当前前沿模型能站稳脚跟,与一年前耗资数十亿美元的系统相比表现更胜一筹
50%待验证Qwen3 27B模型可以在配置不错的笔记本电脑上本地运行,无需依赖云端API或数据中心
50%待验证Qwen3训练后期单个任务的完成需要耗费数天时间
50%