待验证50% 置信基准精确时间
用2840亿参数的DeepSeek V4 Flash实测,token生成从37提升到53 tokens/s(约1.5倍),Prompt Processing从483跃升到1485 tokens/s(约三倍)
1
来源数
50%
置信度
中期 (~90 天)
时效性
2026/9/23
首次发现
有效期至:2026/12/22
来源
涉及实体
相关事实
待验证M3 Ultra运行四位DeepSeek R1时,1000 token上下文约每秒生成19个token占用392GB,16000 token时降到约每秒15个占用410GB77% 相似待验证本地部署DS4模型在STM32嵌入式开发测试中平均输出速度约为23 tokens/秒,推理时内存占用飙升至110GB,峰值速度达83.8 tokens/秒76% 相似待验证UP主估计使用50GB显存显卡后推理速度可能提升到30~40 tokens/s(未经实测确认)71% 相似待验证在4×RTX 3090 SXM4配置下,GLM-5.2量化版本的Token生成速度约为6.3-6.8 tokens/秒,提示评估速度约为10.6 tokens/秒71% 相似待验证运行Qwen3-Next-Flash(Autoround W4A16量化)时,预填充速度约1.3k tokens/s,生成速度达70 tokens/s(代码)/60 tokens/s(散文),支持128k+长上下文70% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/944878API
curl https://kongchang.com/api/v1/knowledge/claims/944878MCP
get_claim(id=944878)