待验证50% 置信基准精确时间
在显存充足、模型完整驻留GPU时,RTX 4090跑Q4量化的27B模型通常可达15~30 tokens/s;触发CPU卸载后速度可能骤降至1~2 tokens/s甚至更低
1
来源数
50%
置信度
中期 (~90 天)
时效性
2026/7/12
首次发现
有效期至:2026/10/10
来源
4090跑Qwen3 27B为何这么慢?本地推理性能优化实战
redditr/ollama2026/7/10
相关事实
待验证RTX 5090上Qwen3.6 27B模型预填充速度从174提升到253 token/s,显存占用约18GB81% 相似待验证对于RTX 4090(24GB显存),WhichLLM可能会推荐Qwen3.6 27B的Q5量化版本,预计推理速度约为每秒27 Token77% 相似待验证在24GB显存的显卡上运行Qwen3.6 27B模型,未经优化可达每秒约40个Token的生成速度,优化后可达50-60 Token/s77% 相似待验证RTX 5090上Qwen3.6 27B模型Q4量化不开MTP解码速度约63 token/s,开启MTP后跳到105 token/s76% 相似待验证RTX 5090上Qwen3.6 35B-A3B推理速度达220 token/s,显存占用约23GB75% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/489738API
curl https://kongchang.com/api/v1/knowledge/claims/489738MCP
get_claim(id=489738)