Unverified50% confidenceBenchmarkExact time
一个800万参数(8.3M)的沙盒引擎在2019年发布的6核桌面CPU上跑出约2000 tokens/秒的解码速度
1
Sources
50%
Confidence
Medium-term (~90 days)
Relevance
7/17/2026
First Seen
Valid until: 10/15/2026
Sources
Related Claims
Partially Verified对于7B参数模型的4-bit量化版本,通常需要至少8GB内存和现代多核CPU即可流畅运行,推理速度约为每秒10-30个token69% similarUnverifiedApple M2/M3 芯片采用统一内存架构(UMA),llama.cpp 通过 Metal API 可达到约 30-50 tokens/秒的 7B 模型推理速度67% similarUnverified以 Llama-3 70B 为例,在 A100 80GB GPU 上处理 32K token 的预填充阶段约需 800-1200ms,而处理 2K token 仅需约 50ms67% similarUnverified在预填充速度测试中,Halo约650 tokens/s,Spark约2000 tokens/s,Spark快了将近三倍67% similarUnverified搭载AMD 780M/Radeon 890M核显的迷你机,需插满双通道内存(2x16GB以上)才能发挥完整核显性能,单条内存会导致核显帧率腰斩约40%67% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/538383API
curl https://kongchang.com/api/v1/knowledge/claims/538383MCP
get_claim(id=538383)