待验证50% 置信事实精确时间
V4.1 Flash使用CSA2(压缩稀疏注意力2)技术并结合FP4格式缓存数据,将全局KV Cache占用压缩到每token仅890字节
1
来源数
50%
置信度
长期有效
时效性
2026/9/22
首次发现
来源
涉及实体
相关事实
待验证DeepSeek V4.1 Flash通过KV缓存层间交替与复用优化,将每token存储量从上一代的3500字节降至约890字节79% 相似待验证随着上下文变长,V4.1 Flash 的内存占用增幅越来越平缓,能以更低资源支撑更长输入窗口74% 相似待验证Flash Attention通过重新组织计算顺序减少GPU高带宽内存的读写次数,在不改变计算结果的前提下实现2-4倍的速度提升72% 相似已验证量化KV缓存(如FP8或INT4存储KV向量)可将缓存大小压缩到原来的1/2甚至1/472% 相似待验证在DeepSeek-V4.1-Flash中,只有四个层负责写入压缩后的KV,模型其余部分共享这份缓存71% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/941026API
curl https://kongchang.com/api/v1/knowledge/claims/941026MCP
get_claim(id=941026)