[控场AI]
模型Qwen3 27B

Qwen3-27B

阿里巴巴Qwen3系列中的270亿参数开源模型,以高性价比著称,可在消费级或中端专业级硬件上本地部署,综合性能接近前沿水平

时间轴 (近 90 天)

10月4日

在六个真实长链agentic构建任务中,Qwen3-27B得35/60并交付可运行应用,而Bonsai 2全线崩溃,未产出任何可运行页面

待验证50%
10月4日

在关闭思考功能的简单任务和长上下文测试中,Bonsai 2与全精度Qwen3-27B表现几乎打成平手,98%承诺基本成立

待验证50%
10月4日

Bonsai 2采用从Qwen3-27B架构出发以三值约束为目标的完整重新训练,而非对已有权重做后期量化(post-training quantization)

待验证60%
10月4日

Bonsai 2是由Prism ML推出的三值量化大模型,以Qwen3-27B为底座重新训练,整个文件约6GB

待验证50%
9月11日

Qwen3-27B的16个全注意力层每层拥有4个KV头、256的头维度,在16位精度下每个Token占用64KB

待验证50%
9月11日

Unsloth将Qwen3-27B的GGUF仓库更新到动态3.0配方,校准从45个重要性矩阵块扩展到超过1200个,单文件可使用多达14种不同的GGML量化类型

待验证50%
9月11日

Apple Silicon上原生推荐使用MLX 4位仿射量化(组大小64),4位MLX构建约占15GB统一内存

待验证50%
9月11日

NVFP4版Qwen3-27B在MMLU Pro和GPQA Diamond基准上相较未压缩FP16仅有微弱损失

待验证50%
9月11日

NVFP4版Qwen3-27B采用敏感度感知混合精度:前馈层以FP4(E2M1)带FP8块缩放运行,注意力投影、DeltaNet递归层、视觉编码器和多Token预测头保持FP8或BF16

待验证50%
9月6日

Qwen3-27B在4×RTX 4090上开启前缀缓存和DFlash2投机解码后,总吞吐量下降约37%

已过期50%

还有 9 条时间轴事件

全部知识事实 (18)

待验证

Bonsai 2采用从Qwen3-27B架构出发以三值约束为目标的完整重新训练,而非对已有权重做后期量化(post-training quantization)

60%
待验证

在六个真实长链agentic构建任务中,Qwen3-27B得35/60并交付可运行应用,而Bonsai 2全线崩溃,未产出任何可运行页面

50%
待验证

在关闭思考功能的简单任务和长上下文测试中,Bonsai 2与全精度Qwen3-27B表现几乎打成平手,98%承诺基本成立

50%
待验证

Bonsai 2是由Prism ML推出的三值量化大模型,以Qwen3-27B为底座重新训练,整个文件约6GB

50%
待验证

Qwen3-27B的16个全注意力层每层拥有4个KV头、256的头维度,在16位精度下每个Token占用64KB

50%
待验证

Unsloth将Qwen3-27B的GGUF仓库更新到动态3.0配方,校准从45个重要性矩阵块扩展到超过1200个,单文件可使用多达14种不同的GGML量化类型

50%
待验证

NVFP4版Qwen3-27B采用敏感度感知混合精度:前馈层以FP4(E2M1)带FP8块缩放运行,注意力投影、DeltaNet递归层、视觉编码器和多Token预测头保持FP8或BF16

50%
待验证

NVFP4版Qwen3-27B在MMLU Pro和GPQA Diamond基准上相较未压缩FP16仅有微弱损失

50%
待验证

Apple Silicon上原生推荐使用MLX 4位仿射量化(组大小64),4位MLX构建约占15GB统一内存

50%
待验证

在约52个并发连接时系统基本100%饱和,最大每秒生成约704个token,但延迟飙升至64秒

50%
待验证

24GB显存是部署的甜点区,跑4Bit量化后仍有余量,性价比最高

50%
待验证

单卡RTX 4090跑4Bit量化的通义千问3-27B约每秒生成49个字

50%
待验证

通义千问3-27B满血版需要55.6GB显存,而量化版仅需17GB

50%
待验证

通义千问3-27B采用Apache 2.0协议,支持免费商用、自定义权重、图片与视频多模态理解,原生上下文长度达256K

50%
待验证

24GB显存跑4Bit量化是通义千问3-27B部署的性价比甜点区,日常使用完全够用

50%
待验证

稠密架构意味着模型在推理时会激活全部270亿参数进行计算

50%
待验证

本地部署通义千问3-27B每百万Token的运行成本约为2.7美元,对标GPT-4.5级别的云端API每百万Token高达约150美元,两者相差约50倍

50%
待验证

阿里在8月开源了通义千问3-27B(Qwen3-27B)稠密架构模型,采用Apache 2.0协议

50%

来源文章