待验证50% 置信基准精确时间
在5070 12G显卡配合64G内存的配置下,短聊天场景速度可达93 token/s,128K长上下文为74 token/s
1
来源数
50%
置信度
中期 (~90 天)
时效性
2026/10/5
首次发现
有效期至:2027/1/3
来源
涉及实体
相关事实
待验证4-5 token/秒的速度对于8GB显卡的实际使用而言太慢,16GB显卡可提升到12-14 token/秒进入实际可用范围77% 相似待验证在配备6核锐龙和64GB内存的RTX 5070上,Strata短对话约90 Token/秒,12.8万Token上下文约67 Token/秒,读取提示词约1300 Token/秒77% 相似待验证约1.6M超长上下文配合128并发时,吞吐可达约3700 tokens/s(聚合)75% 相似待验证在8GB显存的消费级显卡上,ActionAssist以Q6_K_L量化格式配合32k上下文窗口和8位KV缓存量化,能够达到122 tokens/秒的推理速度73% 相似待验证UP主使用 RTX 4080S(16GB 显存)+ 64GB 内存配置运行 MiniCPM 2B,实测推理速度可达约 110 token/秒72% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/978781API
curl https://kongchang.com/api/v1/knowledge/claims/978781MCP
get_claim(id=978781)