待验证60% 置信事实精确时间
生成输出的算力消耗通常远高于处理输入,部分厂商区分输入Token与输出Token的独立限额
2
来源数
60%
置信度
长期有效
时效性
2026/7/20
首次发现
来源
相关事实
待验证自回归生成每个Token都需要完整的前向传播,而输入只需一次编码,这是输出比输入贵的成本结构原因74% 相似待验证大语言模型推理中输出 token 的实际硬件成本远高于输入 token,因解码阶段是内存带宽受限的串行过程74% 相似待验证代码场景中输入侧需携带大量代码上下文,输入 Token 量往往数倍于输出,放大成本71% 相似待验证语义缓存通过将用户请求转化为向量嵌入,在向量空间中计算语义相似度,将语义相近的问题映射到同一缓存结果,从而减少模型调用次数和Token消耗66% 相似待验证在基于 LLM 的 AI 编程助手中,Token 是计算成本的基本单位,输入和输出文本都会被切分为 Token 计费64% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/573974API
curl https://kongchang.com/api/v1/knowledge/claims/573974MCP
get_claim(id=573974)