Unverified50% confidenceFactExact time
GQA让多个Query头共享同一组Key和Value头,可将KV Cache大小减少至原来的1/4,且在基准测试上模型质量差距通常小于1%
1
Sources
50%
Confidence
Long-term
Relevance
8/20/2026
First Seen
Sources
Related Claims
UnverifiedOllama分发的DeepSeek R1各版本均经过GGUF格式量化处理(通常为Q4_K_M或Q8_0精度),将每个参数从16位浮点数压缩至4-8位,显存占用减少50%-75%,推理质量损失通常在5%以内70% similarUnverifiedGGUF格式的Q4_K_M是最主流的平衡选择,困惑度损失通常低于1%;Q8_0几乎无精度损失但文件体积是Q4的两倍67% similarVerifiedGGUF量化格式(如Q4_K_M)通过将权重精度从32位浮点压缩到4位整数,通常只带来约1-5%的性能损失66% similarUnverifiedQwen 2.5 7B使用4组GQA配置,推理时KV Cache体积相比MHA减少约75%62% similarVerifiedQ4量化将每个权重参数从16位压缩到4位,理论上可将模型体积缩小约75%62% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/778810API
curl https://kongchang.com/api/v1/knowledge/claims/778810MCP
get_claim(id=778810)