待验证50% 置信事实精确时间
DeepEP 将 Token 数据从 BF16 压缩为 FP8 E4M3,体积减半,并为每个 Token 附带一个 scale 因子用于还原,属于 per-token 量化粒度
1
来源数
50%
置信度
长期有效
时效性
2026/10/3
首次发现
来源
涉及实体
相关事实
待验证K8V4非对称量化将Key压缩到8位、Value压缩到4位,使128K上下文的KV Cache从16GB降到约6GB68% 相似已验证量化KV缓存(如FP8或INT4存储KV向量)可将缓存大小压缩到原来的1/2甚至1/468% 相似待验证M3 Ultra运行四位DeepSeek R1时,1000 token上下文约每秒生成19个token占用392GB,16000 token时降到约每秒15个占用410GB67% 相似待验证FP8 KV cache是将注意力机制中的Key-Value缓存从FP16或BF16压缩到8位的量化技术,可将KV cache显存占用减半67% 相似待验证Towards AI最终选择采用DeepSeq V4 Flash加混合检索,记忆策略尽量保留全部并设30K token压缩阈值作为兜底66% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/970622API
curl https://kongchang.com/api/v1/knowledge/claims/970622MCP
get_claim(id=970622)