Unverified50% confidenceBenchmarkExact time
Gemma量化模型在高性能笔记本电脑上Token生成速度可达每秒20-50个,纯CPU推理约5-15 tokens/秒,INT4量化下NVIDIA RTX 4060/4070可将推理速度提升3-5倍
1
Sources
50%
Confidence
Medium-term (~90 days)
Relevance
7/16/2026
First Seen
Valid until: 10/14/2026
Sources
Related Claims
UnverifiedQwen3-0.6B 经 INT4 量化后模型文件仅约 400MB,保留约 95% 基准能力,普通笔记本 CPU 即可实现每秒 10-30 token 生成速度78% similarUnverified在配备96GB显存的M2 Max上以1-bit精度运行时,简单任务生成速度稳定在约28-30 tokens/秒76% similarUnverified在RTX 5090上,Muse Glimmer生成速度从每秒75个Token提升到233个Token,提速约3.1倍75% similarUnverifiedGemma 4 26B MOE版本在24GB显存GPU上实际推理速度达到每秒60个Token72% similarUnverifiedCollapse推理速度:CPU上单条10-token上下文约0.23毫秒,MPS在batch 1024下约230万token/秒,最近邻查询约0.48毫秒72% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/530560API
curl https://kongchang.com/api/v1/knowledge/claims/530560MCP
get_claim(id=530560)