Unverified50% confidenceFactExact time
Prompt Caching缓存的是输入而非输出,缓存LLM的输出几乎没有意义
1
Sources
50%
Confidence
Long-term
Relevance
8/12/2026
First Seen
Sources
Related Claims
Unverified自回归生成每个Token都需要完整的前向传播,而输入只需一次编码,这是输出比输入贵的成本结构原因61% similarUnverified生成输出的算力消耗通常远高于处理输入,部分厂商区分输入Token与输出Token的独立限额58% similarUnverified传统缓存机制只能匹配完全一致的字符串,导致语义等价的请求被当作全新查询发送给大模型58% similarUnverified语言模型生成 token 本质上是内存带宽受限任务而非纯算力受限57% similarUnverified语义缓存通过将用户请求转化为向量嵌入,在向量空间中计算语义相似度,将语义相近的问题映射到同一缓存结果,从而减少模型调用次数和Token消耗57% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/736873API
curl https://kongchang.com/api/v1/knowledge/claims/736873MCP
get_claim(id=736873)