待验证50% 置信基准精确时间
在8GB显卡上,token生成速度约为4.2到5 token/秒,且随着上下文变长速度从约6 token/秒下降到4.2左右
1
来源数
50%
置信度
中期 (~90 天)
时效性
2026/9/11
首次发现
有效期至:2026/12/10
来源
涉及实体
相关事实
已验证Human reading speed is roughly 5-8 tokens per second73% 相似已验证在输出(Decode)速度测试中,2 万 token 以内可达约 45 tokens/秒,3 万 token 以上骤降至约 20 tokens/秒72% 相似待验证本地模型推理速度约1-10 tokens/秒,而云端API可达50-150 tokens/秒71% 相似待验证该测试中模型短上下文场景输出速度约20 token/秒,200K+上下文降至约13 token/秒71% 相似待验证Tidy 处理短文本(100-500 token)时推理延迟约为首次加载1-2秒加计算200-800毫秒,连续使用对电池续航影响小于5%每小时68% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/907302API
curl https://kongchang.com/api/v1/knowledge/claims/907302MCP
get_claim(id=907302)