Unverified50% confidenceBenchmarkExact time
M3 Ultra运行四位DeepSeek R1时,1000 token上下文约每秒生成19个token占用392GB,16000 token时降到约每秒15个占用410GB
1
Sources
50%
Confidence
Long-term
Relevance
9/3/2026
First Seen
Sources
Related Entities
Related Claims
UnverifiedQuantprobe 宣称能让仅有 6GB 显存和 16GB 内存的机器以 22 tokens/s 的速度运行 30B 级别的模型74% similarUnverifieddecode阶段的生成速度近似等于内存带宽÷模型大小,例如在内存带宽273GB/s的M4 Pro上运行4GB的Q4量化7B模型理论最大生成速度约68 tokens/s73% similarUnverified100万Token在FP16精度下仅KV Cache一项即可消耗数百GB显存,远超单张A100/H100的80GB容量上限72% similarUnverifiedLLaMA-3 70B权重约140GB,推理时每生成一个Token都需要完整遍历一次权重72% similarUnverified以 Llama-3 70B 为例,在 A100 80GB GPU 上处理 32K token 的预填充阶段约需 800-1200ms,而处理 2K token 仅需约 50ms72% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/849905API
curl https://kongchang.com/api/v1/knowledge/claims/849905MCP
get_claim(id=849905)