待验证50% 置信基准精确时间
Naive-N0.5-Flash 单并发可优化到约 2000 token/s,多并发场景下可达每秒 50 token 以上
1
来源数
50%
置信度
长期有效
时效性
2026/9/28
首次发现
来源
涉及实体
相关事实
待验证该配置下35B模型实测单人最高速度约80 Tokens/秒,并发可达500 Tokens/秒以上73% 相似待验证UP主估计使用50GB显存显卡后推理速度可能提升到30~40 tokens/s(未经实测确认)70% 相似待验证用2840亿参数的DeepSeek V4 Flash实测,token生成从37提升到53 tokens/s(约1.5倍),Prompt Processing从483跃升到1485 tokens/s(约三倍)69% 相似待验证在预填充速度测试中,Halo约650 tokens/s,Spark约2000 tokens/s,Spark快了将近三倍67% 相似待验证实际工程中chunk_size在256至1024 token之间、chunk_overlap在20至100 token之间是较为常见的经验范围66% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/957116API
curl https://kongchang.com/api/v1/knowledge/claims/957116MCP
get_claim(id=957116)