待验证50% 置信事件精确时间
有开发者在Mac M2 Max上以0.6B草稿模型搭配8B目标模型复现,因草稿模型仅快约3.5倍导致反而变慢
1
来源数
50%
置信度
中期 (~90 天)
时效性
2026/7/16
首次发现
有效期至:2026/10/14
来源
相关事实
待验证用于文本补全任务的小型模型(1B–7B参数)在拥有8GB或以上统一内存的Mac上可流畅运行,推理延迟保持在几百毫秒以内。72% 相似待验证8GB显存可运行3B-7B量化模型,但推理速度慢70% 相似待验证在对照测试中,35B模型速度约100 tokens/秒(Mac Studio),是9B模型16 tokens/秒的约五倍67% 相似待验证Apple M2/M3 芯片采用统一内存架构(UMA),llama.cpp 通过 Metal API 可达到约 30-50 tokens/秒的 7B 模型推理速度65% 相似部分验证对于7B参数模型的4-bit量化版本,通常需要至少8GB内存和现代多核CPU即可流畅运行,推理速度约为每秒10-30个token64% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/527135API
curl https://kongchang.com/api/v1/knowledge/claims/527135MCP
get_claim(id=527135)