Unverified50% confidenceBenchmarkExact time
在5070 12G显卡配合64G内存的配置下,短聊天场景速度可达93 token/s,128K长上下文为74 token/s
1
Sources
50%
Confidence
Medium-term (~90 days)
Relevance
10/5/2026
First Seen
Valid until: 1/3/2027
Sources
Related Entities
Related Claims
Unverified4-5 token/秒的速度对于8GB显卡的实际使用而言太慢,16GB显卡可提升到12-14 token/秒进入实际可用范围77% similarUnverified在配备6核锐龙和64GB内存的RTX 5070上,Strata短对话约90 Token/秒,12.8万Token上下文约67 Token/秒,读取提示词约1300 Token/秒77% similarUnverified约1.6M超长上下文配合128并发时,吞吐可达约3700 tokens/s(聚合)75% similarUnverified在8GB显存的消费级显卡上,ActionAssist以Q6_K_L量化格式配合32k上下文窗口和8位KV缓存量化,能够达到122 tokens/秒的推理速度73% similarUnverifiedUP主使用 RTX 4080S(16GB 显存)+ 64GB 内存配置运行 MiniCPM 2B,实测推理速度可达约 110 token/秒72% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/978781API
curl https://kongchang.com/api/v1/knowledge/claims/978781MCP
get_claim(id=978781)