Unverified50% confidenceBenchmarkExact time
在M4 Pro芯片、24GB统一内存的MacBook Pro上通过llama.cpp运行,文本解码速度为10.13 tokens/秒,完整任务每个耗时4到7分钟
1
Sources
50%
Confidence
Medium-term (~90 days)
Relevance
9/11/2026
First Seen
Valid until: 12/10/2026
Sources
Related Entities
Related Claims
Unverified在对照测试中,35B模型速度约100 tokens/秒(Mac Studio),是9B模型16 tokens/秒的约五倍77% similarUnverifieddecode阶段的生成速度近似等于内存带宽÷模型大小,例如在内存带宽273GB/s的M4 Pro上运行4GB的Q4量化7B模型理论最大生成速度约68 tokens/s76% similarUnverified用于文本补全任务的小型模型(1B–7B参数)在拥有8GB或以上统一内存的Mac上可流畅运行,推理延迟保持在几百毫秒以内。75% similarUnverified基于MLX框架,顶配Mac机型运行Llama-3-70B量化模型可达约20 tokens/秒的生成速度74% similarUnverified若量化后模型权重为150GB,以273GB/s带宽读取一遍权重约需0.55秒,理论上单token生成速度约为1.8 token/s(未计入计算延迟和跨机通信开销)72% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/909121API
curl https://kongchang.com/api/v1/knowledge/claims/909121MCP
get_claim(id=909121)