待验证50% 置信事实精确时间
HiSparse 结合稀疏索引,只保留真正被查询到的 KV 部分,与传统全量下放的 KV offloading 有本质区别
1
来源数
50%
置信度
长期有效
时效性
2026/9/15
首次发现
来源
涉及实体
相关事实
待验证在相同主机内存、并发配置为 32 条件下,传统 KV offloading 仅能维持 5-6 个请求,而 Hybrid HiSparse 能同时保持 19-25 个请求,有效并发能力提升约 3 到 4 倍75% 相似待验证将 KV 缓存从 FP16 降至 INT8 可节省 50% 显存,降至 INT4 则节省 75%70% 相似待验证vLLM v0.28.0 的分层 KV 卸载(Tiered KV offloading)新增了磁盘层(disk tier),并支持树外(out-of-tree)二级缓存层68% 相似待验证KV缓存运行时提供一种低成本、细粒度、实时的干预能力,填补了模型微调与外部脚手架之间的空白68% 相似已验证MLA 通过低秩分解将 KV Cache 压缩为低维潜在向量,其 d_latent 约为 d_model 的 1/8,可将 KV Cache 显存占用降低至传统多头注意力的 5%-13%68% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/921499API
curl https://kongchang.com/api/v1/knowledge/claims/921499MCP
get_claim(id=921499)