Unverified50% confidenceBenchmarkExact time
用2840亿参数的DeepSeek V4 Flash实测,token生成从37提升到53 tokens/s(约1.5倍),Prompt Processing从483跃升到1485 tokens/s(约三倍)
1
Sources
50%
Confidence
Medium-term (~90 days)
Relevance
9/23/2026
First Seen
Valid until: 12/22/2026
Sources
Related Entities
Related Claims
UnverifiedM3 Ultra运行四位DeepSeek R1时,1000 token上下文约每秒生成19个token占用392GB,16000 token时降到约每秒15个占用410GB77% similarUnverified本地部署DS4模型在STM32嵌入式开发测试中平均输出速度约为23 tokens/秒,推理时内存占用飙升至110GB,峰值速度达83.8 tokens/秒76% similarUnverifiedUP主估计使用50GB显存显卡后推理速度可能提升到30~40 tokens/s(未经实测确认)71% similarUnverified在4×RTX 3090 SXM4配置下,GLM-5.2量化版本的Token生成速度约为6.3-6.8 tokens/秒,提示评估速度约为10.6 tokens/秒71% similarUnverified运行Qwen3-Next-Flash(Autoround W4A16量化)时,预填充速度约1.3k tokens/s,生成速度达70 tokens/s(代码)/60 tokens/s(散文),支持128k+长上下文70% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/944878API
curl https://kongchang.com/api/v1/knowledge/claims/944878MCP
get_claim(id=944878)