Qwen3-27B
阿里巴巴Qwen3系列中的270亿参数开源模型,以高性价比著称,可在消费级或中端专业级硬件上本地部署,综合性能接近前沿水平
时间轴 (近 90 天)
在六个真实长链agentic构建任务中,Qwen3-27B得35/60并交付可运行应用,而Bonsai 2全线崩溃,未产出任何可运行页面
在关闭思考功能的简单任务和长上下文测试中,Bonsai 2与全精度Qwen3-27B表现几乎打成平手,98%承诺基本成立
Bonsai 2采用从Qwen3-27B架构出发以三值约束为目标的完整重新训练,而非对已有权重做后期量化(post-training quantization)
Bonsai 2是由Prism ML推出的三值量化大模型,以Qwen3-27B为底座重新训练,整个文件约6GB
Qwen3-27B的16个全注意力层每层拥有4个KV头、256的头维度,在16位精度下每个Token占用64KB
Unsloth将Qwen3-27B的GGUF仓库更新到动态3.0配方,校准从45个重要性矩阵块扩展到超过1200个,单文件可使用多达14种不同的GGML量化类型
Apple Silicon上原生推荐使用MLX 4位仿射量化(组大小64),4位MLX构建约占15GB统一内存
NVFP4版Qwen3-27B在MMLU Pro和GPQA Diamond基准上相较未压缩FP16仅有微弱损失
NVFP4版Qwen3-27B采用敏感度感知混合精度:前馈层以FP4(E2M1)带FP8块缩放运行,注意力投影、DeltaNet递归层、视觉编码器和多Token预测头保持FP8或BF16
Qwen3-27B在4×RTX 4090上开启前缀缓存和DFlash2投机解码后,总吞吐量下降约37%
还有 9 条时间轴事件
全部知识事实 (18)
Bonsai 2采用从Qwen3-27B架构出发以三值约束为目标的完整重新训练,而非对已有权重做后期量化(post-training quantization)
60%待验证在六个真实长链agentic构建任务中,Qwen3-27B得35/60并交付可运行应用,而Bonsai 2全线崩溃,未产出任何可运行页面
50%待验证在关闭思考功能的简单任务和长上下文测试中,Bonsai 2与全精度Qwen3-27B表现几乎打成平手,98%承诺基本成立
50%待验证Bonsai 2是由Prism ML推出的三值量化大模型,以Qwen3-27B为底座重新训练,整个文件约6GB
50%待验证Qwen3-27B的16个全注意力层每层拥有4个KV头、256的头维度,在16位精度下每个Token占用64KB
50%待验证Unsloth将Qwen3-27B的GGUF仓库更新到动态3.0配方,校准从45个重要性矩阵块扩展到超过1200个,单文件可使用多达14种不同的GGML量化类型
50%待验证NVFP4版Qwen3-27B采用敏感度感知混合精度:前馈层以FP4(E2M1)带FP8块缩放运行,注意力投影、DeltaNet递归层、视觉编码器和多Token预测头保持FP8或BF16
50%待验证NVFP4版Qwen3-27B在MMLU Pro和GPQA Diamond基准上相较未压缩FP16仅有微弱损失
50%待验证Apple Silicon上原生推荐使用MLX 4位仿射量化(组大小64),4位MLX构建约占15GB统一内存
50%待验证在约52个并发连接时系统基本100%饱和,最大每秒生成约704个token,但延迟飙升至64秒
50%待验证24GB显存是部署的甜点区,跑4Bit量化后仍有余量,性价比最高
50%待验证单卡RTX 4090跑4Bit量化的通义千问3-27B约每秒生成49个字
50%待验证通义千问3-27B满血版需要55.6GB显存,而量化版仅需17GB
50%待验证通义千问3-27B采用Apache 2.0协议,支持免费商用、自定义权重、图片与视频多模态理解,原生上下文长度达256K
50%待验证24GB显存跑4Bit量化是通义千问3-27B部署的性价比甜点区,日常使用完全够用
50%待验证稠密架构意味着模型在推理时会激活全部270亿参数进行计算
50%待验证本地部署通义千问3-27B每百万Token的运行成本约为2.7美元,对标GPT-4.5级别的云端API每百万Token高达约150美元,两者相差约50倍
50%待验证阿里在8月开源了通义千问3-27B(Qwen3-27B)稠密架构模型,采用Apache 2.0协议
50%