待验证50% 置信基准精确时间
运行Qwen3-Next-Flash(Autoround W4A16量化)时,预填充速度约1.3k tokens/s,生成速度达70 tokens/s(代码)/60 tokens/s(散文),支持128k+长上下文
1
来源数
50%
置信度
中期 (~90 天)
时效性
2026/9/13
首次发现
有效期至:2026/12/12
来源
涉及实体
相关事实
待验证在4×RTX 3090 SXM4配置下,GLM-5.2量化版本的Token生成速度约为6.3-6.8 tokens/秒,提示评估速度约为10.6 tokens/秒76% 相似待验证该配置下35B模型实测单人最高速度约80 Tokens/秒,并发可达500 Tokens/秒以上73% 相似待验证decode阶段的生成速度近似等于内存带宽÷模型大小,例如在内存带宽273GB/s的M4 Pro上运行4GB的Q4量化7B模型理论最大生成速度约68 tokens/s72% 相似待验证基于MLX框架,顶配Mac机型运行Llama-3-70B量化模型可达约20 tokens/秒的生成速度72% 相似待验证在预填充速度测试中,Halo约650 tokens/s,Spark约2000 tokens/s,Spark快了将近三倍71% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/919202API
curl https://kongchang.com/api/v1/knowledge/claims/919202MCP
get_claim(id=919202)