待验证50% 置信事实精确时间
GQA相比MHA可将KV缓存体积压缩到四分之一,且不明显损失模型质量
1
来源数
50%
置信度
长期有效
时效性
2026/9/12
首次发现
来源
涉及实体
相关事实
待验证MLA通过将KV矩阵压缩为低维潜在向量缓存,理论上可将KV Cache显存占用降低至标准MHA的5%至13%79% 相似待验证LLaMA 2的70B版本采用8组GQA,将KV缓存减少到MHA的1/4,同时几乎不影响模型质量73% 相似待验证GQA 将注意力头分组共享 KV 投影,可将 KV 缓存压缩至原来的 1/4 甚至更低而几乎不损失模型质量71% 相似待验证GQA和MLA等技术可显著压缩KV缓存大小,DeepSeek V3采用了MLA来降低长上下文场景的内存开销70% 相似待验证量化KV Cache(压缩为INT8或INT4)可将缓存内存降低50-75%,但主流推理框架支持成熟度参差不齐69% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/915869API
curl https://kongchang.com/api/v1/knowledge/claims/915869MCP
get_claim(id=915869)