Unverified50% confidenceBenchmarkExact time
在配备96GB显存的M2 Max上以1-bit精度运行时,简单任务生成速度稳定在约28-30 tokens/秒
1
Sources
50%
Confidence
Medium-term (~90 days)
Relevance
7/20/2026
First Seen
Valid until: 10/18/2026
Sources
Related Claims
Unverified在24GB显存的显卡上运行Qwen3.6 27B模型,未经优化可达每秒约40个Token的生成速度,优化后可达50-60 Token/s79% similarUnverified测试者用双4090(48GB显存)工作站运行20.7B稠密模型,每秒生成27.6个Token,仅比矮星略快,但参数量小10倍以上77% similarUnverifiedGemma量化模型在高性能笔记本电脑上Token生成速度可达每秒20-50个,纯CPU推理约5-15 tokens/秒,INT4量化下NVIDIA RTX 4060/4070可将推理速度提升3-5倍76% similarUnverifiedQwen3-0.6B 经 INT4 量化后模型文件仅约 400MB,保留约 95% 基准能力,普通笔记本 CPU 即可实现每秒 10-30 token 生成速度75% similarUnverifiedMTP-LX with 4bit quantization achieves 40+ tokens per second generation speed on Mac, approximately double the speed of the MLX 6bit solution75% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/569985API
curl https://kongchang.com/api/v1/knowledge/claims/569985MCP
get_claim(id=569985)