Verified65% confidenceBenchmarkExact time
在M5 Ultra的1.2TB/s带宽下,100GB量化模型理论速度约12 token/s,200GB约6 token/s,300GB约4 token/s
3
Sources
65%
Confidence
Medium-term (~90 days)
Relevance
9/23/2026
First Seen
Valid until: 12/22/2026
Sources
Related Entities
Related Claims
Unverified70B参数模型(140GB权重)在1TB/s带宽下理论最快生成速度约7 tokens/秒80% similarUnverifiedQuantprobe 宣称能让仅有 6GB 显存和 16GB 内存的机器以 22 tokens/s 的速度运行 30B 级别的模型79% similarVerified128GB DDR5内存能完整加载70B级别模型的所有权重,但速度约为2-5 tokens/s76% similarUnverified在80亿参数模型的文本生成测试中,M5 Ultra每秒188 tokens,M3 Ultra每秒129 tokens,仅为1.45倍76% similarUnverifieddecode阶段的生成速度近似等于内存带宽÷模型大小,例如在内存带宽273GB/s的M4 Pro上运行4GB的Q4量化7B模型理论最大生成速度约68 tokens/s76% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/945139API
curl https://kongchang.com/api/v1/knowledge/claims/945139MCP
get_claim(id=945139)