Unverified50% confidenceFactExact time
HiSparse 结合稀疏索引,只保留真正被查询到的 KV 部分,与传统全量下放的 KV offloading 有本质区别
1
Sources
50%
Confidence
Long-term
Relevance
9/15/2026
First Seen
Sources
Related Entities
Related Claims
Unverified在相同主机内存、并发配置为 32 条件下,传统 KV offloading 仅能维持 5-6 个请求,而 Hybrid HiSparse 能同时保持 19-25 个请求,有效并发能力提升约 3 到 4 倍75% similarUnverified将 KV 缓存从 FP16 降至 INT8 可节省 50% 显存,降至 INT4 则节省 75%70% similarUnverifiedvLLM v0.28.0 的分层 KV 卸载(Tiered KV offloading)新增了磁盘层(disk tier),并支持树外(out-of-tree)二级缓存层68% similarUnverifiedKV缓存运行时提供一种低成本、细粒度、实时的干预能力,填补了模型微调与外部脚手架之间的空白68% similarVerifiedMLA 通过低秩分解将 KV Cache 压缩为低维潜在向量,其 d_latent 约为 d_model 的 1/8,可将 KV Cache 显存占用降低至传统多头注意力的 5%-13%68% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/921499API
curl https://kongchang.com/api/v1/knowledge/claims/921499MCP
get_claim(id=921499)