Unverified60% confidenceBenchmarkExact time
Quantprobe 宣称能让仅有 6GB 显存和 16GB 内存的机器以 22 tokens/s 的速度运行 30B 级别的模型
2
Sources
60%
Confidence
Medium-term (~90 days)
Relevance
8/5/2026
First Seen
Valid until: 11/3/2026
Sources
Related Claims
Verified在M5 Ultra的1.2TB/s带宽下,100GB量化模型理论速度约12 token/s,200GB约6 token/s,300GB约4 token/s79% similarUnverifieddecode阶段的生成速度近似等于内存带宽÷模型大小,例如在内存带宽273GB/s的M4 Pro上运行4GB的Q4量化7B模型理论最大生成速度约68 tokens/s79% similarUnverified若系统内存仅有16GB或32GB,即便显卡型号相同,也可能无法完成完整的推理过程78% similarUnverified48GB内存可以装下4-bit量化的32B模型,但推理速度会慢到可能每秒不到1个token,几乎无法交互使用78% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/689090API
curl https://kongchang.com/api/v1/knowledge/claims/689090MCP
get_claim(id=689090)