待验证50% 置信基准精确时间
测试者用双4090(48GB显存)工作站运行20.7B稠密模型,每秒生成27.6个Token,仅比矮星略快,但参数量小10倍以上
1
来源数
50%
置信度
中期 (~90 天)
时效性
2026/7/25
首次发现
有效期至:2026/10/23
来源
相关事实
待验证在配备96GB显存的M2 Max上以1-bit精度运行时,简单任务生成速度稳定在约28-30 tokens/秒77% 相似待验证在24GB显存的显卡上运行Qwen3.6 27B模型,未经优化可达每秒约40个Token的生成速度,优化后可达50-60 Token/s73% 相似待验证消费级 GPU 如 RTX 4090 拥有 24 GB 显存,可运行数十亿参数的量化模型72% 相似已验证32B参数规模的模型在量化后通常可以压缩到约16-20GB显存占用,一张NVIDIA RTX 4090(24GB显存)就能运行72% 相似待验证27B稠密模型在24GB M4 Pro Mac mini上使用4-bit量化可以运行,速度约为11 tok/s71% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/613179API
curl https://kongchang.com/api/v1/knowledge/claims/613179MCP
get_claim(id=613179)