Unverified50% confidenceFactExact time
V4.1 Flash使用CSA2(压缩稀疏注意力2)技术并结合FP4格式缓存数据,将全局KV Cache占用压缩到每token仅890字节
1
Sources
50%
Confidence
Long-term
Relevance
9/22/2026
First Seen
Sources
Related Entities
Related Claims
UnverifiedDeepSeek V4.1 Flash通过KV缓存层间交替与复用优化,将每token存储量从上一代的3500字节降至约890字节79% similarUnverified随着上下文变长,V4.1 Flash 的内存占用增幅越来越平缓,能以更低资源支撑更长输入窗口74% similarUnverifiedFlash Attention通过重新组织计算顺序减少GPU高带宽内存的读写次数,在不改变计算结果的前提下实现2-4倍的速度提升72% similarVerified量化KV缓存(如FP8或INT4存储KV向量)可将缓存大小压缩到原来的1/2甚至1/472% similarUnverified在DeepSeek-V4.1-Flash中,只有四个层负责写入压缩后的KV,模型其余部分共享这份缓存71% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/941026API
curl https://kongchang.com/api/v1/knowledge/claims/941026MCP
get_claim(id=941026)