Unverified50% confidenceBenchmarkExact time
运行Qwen3-Next-Flash(Autoround W4A16量化)时,预填充速度约1.3k tokens/s,生成速度达70 tokens/s(代码)/60 tokens/s(散文),支持128k+长上下文
1
Sources
50%
Confidence
Medium-term (~90 days)
Relevance
9/13/2026
First Seen
Valid until: 12/12/2026
Sources
Related Entities
Related Claims
Unverified在4×RTX 3090 SXM4配置下,GLM-5.2量化版本的Token生成速度约为6.3-6.8 tokens/秒,提示评估速度约为10.6 tokens/秒76% similarUnverified该配置下35B模型实测单人最高速度约80 Tokens/秒,并发可达500 Tokens/秒以上73% similarUnverifieddecode阶段的生成速度近似等于内存带宽÷模型大小,例如在内存带宽273GB/s的M4 Pro上运行4GB的Q4量化7B模型理论最大生成速度约68 tokens/s72% similarUnverified基于MLX框架,顶配Mac机型运行Llama-3-70B量化模型可达约20 tokens/秒的生成速度72% similarUnverified在预填充速度测试中,Halo约650 tokens/s,Spark约2000 tokens/s,Spark快了将近三倍71% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/919202API
curl https://kongchang.com/api/v1/knowledge/claims/919202MCP
get_claim(id=919202)