Unverified50% confidenceFactExact time
KVFetch将被访问token的位置后继预取到固定大小的热层槽位中,不会增加注意力计算成本
1
Sources
50%
Confidence
Long-term
Relevance
10/8/2026
First Seen
Sources
Related Entities
Related Claims
UnverifiedKV缓存运行时提供一种低成本、细粒度、实时的干预能力,填补了模型微调与外部脚手架之间的空白73% similarUnverifiedHiSparse 结合稀疏索引,只保留真正被查询到的 KV 部分,与传统全量下放的 KV offloading 有本质区别66% similarUnverified模型权重不能把显存占满,必须为 KV 缓存和推理过程预留空间,128K 上下文所需的 KV 缓存可能高达数 GB 甚至超过模型权重本身65% similarUnverified上下文越长,模型需要缓存的 KV Cache 越大,KV Cache 使模型生成新 Token 时无需重新计算所有历史 Token 的注意力权重63% similarUnverifiedKV Cache内存共享机制在束搜索等场景下可节省高达55%的显存62% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/986757API
curl https://kongchang.com/api/v1/knowledge/claims/986757MCP
get_claim(id=986757)