待验证50% 置信事实精确时间
大模型API通常按Token数量计费,且生成速度以Token/秒衡量
1
来源数
50%
置信度
长期有效
时效性
2026/9/8
首次发现
来源
涉及实体
相关事实
待验证大模型调用的计费单位是Token而非请求次数,响应时间从毫秒级变为秒级甚至分钟级77% 相似待验证AirLLM 以推理速度为代价,每生成一个 token 耗时数秒乃至数十秒,远慢于高端 GPU 全量加载的每秒数十 token68% 相似待验证缓存命中率在大模型API调用场景中指KV Cache(键值缓存)的复用比例,模型可直接从缓存中读取已处理token的注意力键值对67% 相似待验证70B参数模型(140GB权重)在1TB/s带宽下理论最快生成速度约7 tokens/秒66% 相似待验证本地部署DS4模型在STM32嵌入式开发测试中平均输出速度约为23 tokens/秒,推理时内存占用飙升至110GB,峰值速度达83.8 tokens/秒65% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/874718API
curl https://kongchang.com/api/v1/knowledge/claims/874718MCP
get_claim(id=874718)