待验证50% 置信基准精确时间
在M4 Pro芯片、24GB统一内存的MacBook Pro上通过llama.cpp运行,文本解码速度为10.13 tokens/秒,完整任务每个耗时4到7分钟
1
来源数
50%
置信度
中期 (~90 天)
时效性
2026/9/11
首次发现
有效期至:2026/12/10
来源
涉及实体
相关事实
待验证在对照测试中,35B模型速度约100 tokens/秒(Mac Studio),是9B模型16 tokens/秒的约五倍77% 相似待验证decode阶段的生成速度近似等于内存带宽÷模型大小,例如在内存带宽273GB/s的M4 Pro上运行4GB的Q4量化7B模型理论最大生成速度约68 tokens/s76% 相似待验证用于文本补全任务的小型模型(1B–7B参数)在拥有8GB或以上统一内存的Mac上可流畅运行,推理延迟保持在几百毫秒以内。75% 相似待验证基于MLX框架,顶配Mac机型运行Llama-3-70B量化模型可达约20 tokens/秒的生成速度74% 相似待验证若量化后模型权重为150GB,以273GB/s带宽读取一遍权重约需0.55秒,理论上单token生成速度约为1.8 token/s(未计入计算延迟和跨机通信开销)72% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/909121API
curl https://kongchang.com/api/v1/knowledge/claims/909121MCP
get_claim(id=909121)