Unverified60% confidenceFactExact time
GQA通过让多个查询头共享同一组KV头,可将KV缓存体积压缩至原来的1/4至1/8
2
Sources
60%
Confidence
Long-term
Relevance
7/19/2026
First Seen
Sources
Related Claims
Unverified使用非GQA架构(KV头数等于查询头数)在相同条件下的KV缓存是GQA的4倍79% similarUnverifiedGQA 将注意力头分组共享 KV 投影,可将 KV 缓存压缩至原来的 1/4 甚至更低而几乎不损失模型质量75% similarUnverified量化KV缓存(如FP8或INT4存储KV向量)可将缓存大小压缩到原来的1/2甚至1/474% similarVerifiedMLA将KV对压缩到低维潜在空间中进行缓存,推理时通过上投影矩阵恢复完整的Key和Value,将KV缓存压缩了数倍72% similarUnverifiedGGUF、AWQ等量化格式能将数百亿参数模型压缩至消费级GPU可运行的体积,同时保持接近原版的性能69% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/561355API
curl https://kongchang.com/api/v1/knowledge/claims/561355MCP
get_claim(id=561355)