Unverified50% confidenceFactExact time
在DeepSeek-V4.1-Flash中,只有四个层负责写入压缩后的KV,模型其余部分共享这份缓存
1
Sources
50%
Confidence
Long-term
Relevance
9/15/2026
First Seen
Sources
Related Entities
Related Claims
Verified量化KV缓存(如FP8或INT4存储KV向量)可将缓存大小压缩到原来的1/2甚至1/470% similarUnverifiedTowards AI最终选择采用DeepSeq V4 Flash加混合检索,记忆策略尽量保留全部并设30K token压缩阈值作为兜底70% similarUnverifiedGQA通过让多个查询头共享同一组KV头,可将KV缓存体积压缩至原来的1/4至1/867% similarUnverifiedKV缓存量化选择Q4_0,能将缓存体积压缩到FP16的约四分之一,且对输出质量影响远小于模型权重量化66% similarVerifiedMLA将KV对压缩到低维潜在空间中进行缓存,推理时通过上投影矩阵恢复完整的Key和Value,将KV缓存压缩了数倍66% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/921484API
curl https://kongchang.com/api/v1/knowledge/claims/921484MCP
get_claim(id=921484)