待验证50% 置信事实精确时间
提示词缓存通过在服务器端保存已计算的 KV 矩阵,将重复前缀的处理从 O(n²) 降低至 O(1) 的缓存读取,可实现高达90%的延迟和成本压缩
1
来源数
50%
置信度
长期有效
时效性
2026/7/7
首次发现
来源
Claude花$149主导开发sqlite-utils 4.0:AI编程能力的真实样本
hackernewshackernews2026/7/5
相关事实
待验证KV缓存的规律是:上下文长度翻倍缓存大致翻倍,并发满上下文请求翻倍缓存再翻倍74% 相似待验证KV缓存将已计算的Key-Value矩阵存储在显存中实现增量计算,代价是显存占用随序列长度线性增长73% 相似待验证Prompt缓存(KV Cache)在相同系统提示多次使用时可复用缓存的KV矩阵,通常将延迟降低40-60%、成本降低50-90%72% 相似待验证将 KV 缓存从 FP16 降至 INT8 可节省 50% 显存,降至 INT4 则节省 75%69% 相似待验证MLA 将所有头的 Key 和 Value 联合压缩为低维潜在向量缓存,本质上是对 KV Cache 做低秩分解69% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/126792API
curl https://kongchang.com/api/v1/knowledge/claims/126792MCP
get_claim(id=126792)