Unverified50% confidenceFactExact time
GQA相比MHA可将KV缓存体积压缩到四分之一,且不明显损失模型质量
1
Sources
50%
Confidence
Long-term
Relevance
9/12/2026
First Seen
Sources
Related Entities
Related Claims
UnverifiedMLA通过将KV矩阵压缩为低维潜在向量缓存,理论上可将KV Cache显存占用降低至标准MHA的5%至13%79% similarUnverifiedLLaMA 2的70B版本采用8组GQA,将KV缓存减少到MHA的1/4,同时几乎不影响模型质量73% similarUnverifiedGQA 将注意力头分组共享 KV 投影,可将 KV 缓存压缩至原来的 1/4 甚至更低而几乎不损失模型质量71% similarUnverifiedGQA和MLA等技术可显著压缩KV缓存大小,DeepSeek V3采用了MLA来降低长上下文场景的内存开销70% similarUnverified量化KV Cache(压缩为INT8或INT4)可将缓存内存降低50-75%,但主流推理框架支持成熟度参差不齐69% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/915869API
curl https://kongchang.com/api/v1/knowledge/claims/915869MCP
get_claim(id=915869)