待验证50% 置信基准精确时间
在5070 12G显卡加64G内存配置下开启MTP后,生成速度能达到50 tokens/s以上,官方测试可达60~95 tokens/s
1
来源数
50%
置信度
中期 (~90 天)
时效性
2026/10/5
首次发现
有效期至:2027/1/3
来源
涉及实体
相关事实
待验证使用SGLang同时开启Prefix Cache和MTP后,token生成速度提升到约40-50 tokens/s75% 相似待验证同等参数的Dense模型在没有MTP的情况下,生成速度通常只有40-50 tokens/s75% 相似待验证在预填充速度测试中,Halo约650 tokens/s,Spark约2000 tokens/s,Spark快了将近三倍75% 相似待验证在llama.cpp的真实跑分线程中,2021年M1 Max解码写入速度61 tokens/s,高于2024年M4 Pro的51 tokens/s71% 相似待验证该配置下35B模型实测单人最高速度约80 Tokens/秒,并发可达500 Tokens/秒以上69% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/978797API
curl https://kongchang.com/api/v1/knowledge/claims/978797MCP
get_claim(id=978797)