Qwen 3.8
阿里巴巴通义千问系列下一代旗舰模型,目标超越GLM 5.2,处于密集测试与发布窗口期
Core Facts
Timeline (last 90 days)
两款模型均受llama.cpp、Ollama、LM Studio支持,也都支持MTP多token预测推测解码加速
在超长上下文测试中,Ornith 1.5早期约75 token/秒,超过160万token后降至约45 token/秒,而Qwen 3.8在相同负载下降至约5 token/秒
在配备512GB统一内存的Apple M3 Ultra上构建3D游戏测试中,Qwen 3.8一次性完成,Ornith 1.5需要6轮独立迭代才勉强接近同等水平
Artificial Analysis作为与阿里巴巴无财务关系的第三方机构,给Qwen 3.8智能指数打52分,代理指数打51分
阿里巴巴Qwen团队的Qwen 3.8 27B于2026年8月14日发布
Qwen 3.8 采用 Apache 2.0 协议的稠密模型,27.7B参数全量激活
在30道 Three.js One-Shot 编程题测试中,Qwen 3.8 通过24题,Ornith 1.5 通过15题,均在Q6量化下运行
Ornith 1.5 推荐 Q4_K_M 量化时整包约需23G显存,建议按27G以上准备;Qwen 3.8 同档 Q4_K_M 只需16到19G
在Artificial Analysis同轮评测中 Qwen 3.8 生成约1.6亿Token,而同级开放模型中位数为4300万Token
Artificial Analysis 给 Qwen 3.8 打出52的智能指数,追平满推理档的 GPT-5.6,智能体分51,高于 Claude Opus 4.8
13 more timeline events
All Facts (20)
Q5_K_M 量化方案每个权重平均约 5.3 比特,32B 参数模型量化后大约需要 20-24GB 存储空间
75%VerifiedQwen3引入了'思考模式'(thinking mode),允许模型在回答前进行内部推理链展开,类似于OpenAI o1系列的Chain-of-Thought推理方式
65%UnverifiedQwen3.5采用混合注意力架构,将Gated Delta Net(线性注意力变体)和Gated Attention(常规注意力)混合使用
90%Unverified两款模型均受llama.cpp、Ollama、LM Studio支持,也都支持MTP多token预测推测解码加速
50%UnverifiedArtificial Analysis作为与阿里巴巴无财务关系的第三方机构,给Qwen 3.8智能指数打52分,代理指数打51分
50%Unverified在配备512GB统一内存的Apple M3 Ultra上构建3D游戏测试中,Qwen 3.8一次性完成,Ornith 1.5需要6轮独立迭代才勉强接近同等水平
50%Unverified在超长上下文测试中,Ornith 1.5早期约75 token/秒,超过160万token后降至约45 token/秒,而Qwen 3.8在相同负载下降至约5 token/秒
50%UnverifiedOrnith 1.5 推荐 Q4_K_M 量化时整包约需23G显存,建议按27G以上准备;Qwen 3.8 同档 Q4_K_M 只需16到19G
50%UnverifiedQwen 3.8 采用 Apache 2.0 协议的稠密模型,27.7B参数全量激活
50%Unverified在30道 Three.js One-Shot 编程题测试中,Qwen 3.8 通过24题,Ornith 1.5 通过15题,均在Q6量化下运行
50%Unverified在从零生成3D游戏任务中,Qwen 3.8 一次提示零引导完成,Ornith 1.5 需迭代六轮
50%UnverifiedArtificial Analysis 给 Qwen 3.8 打出52的智能指数,追平满推理档的 GPT-5.6,智能体分51,高于 Claude Opus 4.8
50%Unverified在Artificial Analysis同轮评测中 Qwen 3.8 生成约1.6亿Token,而同级开放模型中位数为4300万Token
50%UnverifiedQwen 3.8(270亿参数,Q4量化)每token需读取约17GB内存
50%Unverified上下文窗口越大,缓存越多、内存占用越大、速度越慢;以Qwen 3.8为例,256K上下文窗口的缓存可达17GB,速度比小窗口慢两倍
50%Unverified跑Qwen 3.8基础能力的最低目标是配备48GB内存的Mac mini M5 Pro,价格约2300美元
50%Unverified在Artificial Analysis基准中,GLM 5.3 Flash幻觉分数为7,Qwen 3.8(270亿)为-10,本地模型幻觉率高于云端
50%UnverifiedQwen 3.8在M5 Max上基础速度为22 token/s,开启MTP后可提升到34甚至56 token/s
50%Unverified在27B参数规模上,过度激进的权重编辑会导致Qwen 3.8模型陷入思维循环,无法完成正常推理
50%Unverified在预填充阶段Ornith速度接近每秒200个Token,比Qwen快约20个Token
50%