Unverified50% confidenceBenchmarkExact time
在5070 12G显卡加64G内存配置下开启MTP后,生成速度能达到50 tokens/s以上,官方测试可达60~95 tokens/s
1
Sources
50%
Confidence
Medium-term (~90 days)
Relevance
10/5/2026
First Seen
Valid until: 1/3/2027
Sources
Related Entities
Related Claims
Unverified使用SGLang同时开启Prefix Cache和MTP后,token生成速度提升到约40-50 tokens/s75% similarUnverified同等参数的Dense模型在没有MTP的情况下,生成速度通常只有40-50 tokens/s75% similarUnverified在预填充速度测试中,Halo约650 tokens/s,Spark约2000 tokens/s,Spark快了将近三倍75% similarUnverified在llama.cpp的真实跑分线程中,2021年M1 Max解码写入速度61 tokens/s,高于2024年M4 Pro的51 tokens/s71% similarUnverified该配置下35B模型实测单人最高速度约80 Tokens/秒,并发可达500 Tokens/秒以上69% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/978797API
curl https://kongchang.com/api/v1/knowledge/claims/978797MCP
get_claim(id=978797)