Expired65% confidenceFactTime unknown
RTX 5090上Qwen3.6 27B模型预填充速度从174提升到253 token/s,显存占用约18GB
3
Sources
65%
Confidence
Medium-term (~90 days)
Relevance
6/1/2026
First Seen
Valid until: 8/30/2026(expired)
Sources
Qwen3.6 MTP加速实测:单GPU推理飙到220 token/s
bilibili普通鱼学家呀
Related Entities
Related Claims
UnverifiedRTX 5090上Qwen3.6 35B-A3B推理速度达220 token/s,显存占用约23GB90% similarUnverified在显存充足、模型完整驻留GPU时,RTX 4090跑Q4量化的27B模型通常可达15~30 tokens/s;触发CPU卸载后速度可能骤降至1~2 tokens/s甚至更低81% similarUnverified在24GB显存的显卡上运行Qwen3.6 27B模型,未经优化可达每秒约40个Token的生成速度,优化后可达50-60 Token/s80% similarVerified该工作流在RTX 3060 6GB显存加16GB内存配置下即可运行79% similarUnverified对于RTX 4090(24GB显存),WhichLLM可能会推荐Qwen3.6 27B的Q5量化版本,预计推理速度约为每秒27 Token78% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/18059API
curl https://kongchang.com/api/v1/knowledge/claims/18059MCP
get_claim(id=18059)