待验证50% 置信事实精确时间
本地模型推理速度约1-10 tokens/秒,而云端API可达50-150 tokens/秒
1
来源数
50%
置信度
中期 (~90 天)
时效性
2026/9/9
首次发现
有效期至:2026/12/8
来源
涉及实体
相关事实
待验证在输出(Decode)速度测试中,2 万 token 以内可达约 45 tokens/秒,3 万 token 以上骤降至约 20 tokens/秒77% 相似待验证启用MTP后推理速度波动显著,有时超过40 tokens/秒,有时降至25 tokens/秒73% 相似待验证通常认为单并发 100 tokens/秒以上即可实现流畅的打字机效果,约 200 tokens/秒生成 2000 字长文本仅需约 10 秒71% 相似待验证在Flappy Bird HTML游戏生成测试中,未启用MTP时速度为31.15 tokens/秒,启用MTP后达到37.3 tokens/秒,提升约20%66% 相似待验证ChatGPT标准模式的输出速度通常在50-100 Token/秒左右66% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/881644API
curl https://kongchang.com/api/v1/knowledge/claims/881644MCP
get_claim(id=881644)