Unverified50% confidenceBenchmarkExact time
测试者用双4090(48GB显存)工作站运行20.7B稠密模型,每秒生成27.6个Token,仅比矮星略快,但参数量小10倍以上
1
Sources
50%
Confidence
Medium-term (~90 days)
Relevance
7/25/2026
First Seen
Valid until: 10/23/2026
Sources
Related Claims
Unverified在配备96GB显存的M2 Max上以1-bit精度运行时,简单任务生成速度稳定在约28-30 tokens/秒77% similarUnverified在24GB显存的显卡上运行Qwen3.6 27B模型,未经优化可达每秒约40个Token的生成速度,优化后可达50-60 Token/s73% similarUnverified消费级 GPU 如 RTX 4090 拥有 24 GB 显存,可运行数十亿参数的量化模型72% similarVerified32B参数规模的模型在量化后通常可以压缩到约16-20GB显存占用,一张NVIDIA RTX 4090(24GB显存)就能运行72% similarUnverified27B稠密模型在24GB M4 Pro Mac mini上使用4-bit量化可以运行,速度约为11 tok/s71% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/613179API
curl https://kongchang.com/api/v1/knowledge/claims/613179MCP
get_claim(id=613179)