待验证50% 置信基准精确时间
开发者Primitive报告:关闭推测时为91.2 tokens/s,开启3个推测token后达到142.6 tokens/s,同一配置下约提速56%
1
来源数
50%
置信度
中期 (~90 天)
时效性
2026/9/28
首次发现
有效期至:2026/12/27
来源
涉及实体
相关事实
已验证在4×RTX 3090 SXM4配置下,GLM-5.2量化版本的Token生成速度约为6.3-6.8 tokens/秒,提示评估速度约为10.6 tokens/秒77% 相似待验证客户端观测显示修复任务输出速度约242 tokens/秒、Web任务约269 tokens/秒,输入缓存命中率分别约92.5%和97.8%73% 相似待验证在预填充速度测试中,Halo约650 tokens/s,Spark约2000 tokens/s,Spark快了将近三倍73% 相似待验证运行Qwen3-Next-Flash(Autoround W4A16量化)时,预填充速度约1.3k tokens/s,生成速度达70 tokens/s(代码)/60 tokens/s(散文),支持128k+长上下文71% 相似待验证该配置下35B模型实测单人最高速度约80 Tokens/秒,并发可达500 Tokens/秒以上70% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/956793API
curl https://kongchang.com/api/v1/knowledge/claims/956793MCP
get_claim(id=956793)