Unverified60% confidenceFactTime unknown
在24GB显存的显卡上运行Qwen3.6 27B模型,未经优化可达每秒约40个Token的生成速度,优化后可达50-60 Token/s
1
Sources
60%
Confidence
Medium-term (~90 days)
Relevance
6/1/2026
First Seen
Valid until: 8/30/2026
Sources
Hermes + Qwen3.6 本地部署教程:零成本搭建私有AI Agent
bilibili零度解说
Related Entities
Related Claims
UnverifiedQwen3-0.6B 经 INT4 量化后模型文件仅约 400MB,保留约 95% 基准能力,普通笔记本 CPU 即可实现每秒 10-30 token 生成速度84% similarUnverifiedRTX 5090上Qwen3.6 27B模型预填充速度从174提升到253 token/s,显存占用约18GB80% similarUnverified在配备96GB显存的M2 Max上以1-bit精度运行时,简单任务生成速度稳定在约28-30 tokens/秒79% similarUnverifiedRTX 5090上Qwen3.6 35B-A3B推理速度达220 token/s,显存占用约23GB78% similarUnverifiedQwen-7B经过4-bit量化后,一张搭载24GB显存的消费级显卡即可流畅运行78% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/18000API
curl https://kongchang.com/api/v1/knowledge/claims/18000MCP
get_claim(id=18000)