待验证50% 置信基准精确时间
llama.cpp的GGUF格式4-bit量化版本使Llama 3.1 70B模型可在配备64GB统一内存的Apple M2 Ultra上运行,推理速度约20-30 tokens/秒
1
来源数
50%
置信度
中期 (~90 天)
时效性
2026/7/16
首次发现
有效期至:2026/10/14
来源
相关事实
待验证Apple M2/M3 芯片采用统一内存架构(UMA),llama.cpp 通过 Metal API 可达到约 30-50 tokens/秒的 7B 模型推理速度80% 相似待验证配备192GB统一内存的Mac Studio M4 Ultra理论上可以运行完整的70B甚至更大参数的模型77% 相似已验证一台配备 16GB 内存的普通 Mac 借助 GGUF 量化格式可流畅运行 7B 至 13B 参数的模型75% 相似待验证Quantprobe 宣称能让仅有 6GB 显存和 16GB 内存的机器以 22 tokens/s 的速度运行 30B 级别的模型75% 相似待验证Ollama通过GGUF格式的4-bit/8-bit量化可将70B模型压缩至在16GB显存的消费级GPU甚至Apple Silicon芯片上运行75% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/529150API
curl https://kongchang.com/api/v1/knowledge/claims/529150MCP
get_claim(id=529150)