待验证50% 置信基准精确时间
M3 Ultra运行四位DeepSeek R1时,1000 token上下文约每秒生成19个token占用392GB,16000 token时降到约每秒15个占用410GB
1
来源数
50%
置信度
长期有效
时效性
2026/9/3
首次发现
来源
涉及实体
相关事实
待验证Quantprobe 宣称能让仅有 6GB 显存和 16GB 内存的机器以 22 tokens/s 的速度运行 30B 级别的模型74% 相似待验证decode阶段的生成速度近似等于内存带宽÷模型大小,例如在内存带宽273GB/s的M4 Pro上运行4GB的Q4量化7B模型理论最大生成速度约68 tokens/s73% 相似待验证100万Token在FP16精度下仅KV Cache一项即可消耗数百GB显存,远超单张A100/H100的80GB容量上限72% 相似待验证LLaMA-3 70B权重约140GB,推理时每生成一个Token都需要完整遍历一次权重72% 相似待验证以 Llama-3 70B 为例,在 A100 80GB GPU 上处理 32K token 的预填充阶段约需 800-1200ms,而处理 2K token 仅需约 50ms72% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/849905API
curl https://kongchang.com/api/v1/knowledge/claims/849905MCP
get_claim(id=849905)