待验证50% 置信事实精确时间
GQA让多个Query头共享同一组Key和Value头,可将KV Cache大小减少至原来的1/4,且在基准测试上模型质量差距通常小于1%
1
来源数
50%
置信度
长期有效
时效性
2026/8/20
首次发现
来源
相关事实
待验证Ollama分发的DeepSeek R1各版本均经过GGUF格式量化处理(通常为Q4_K_M或Q8_0精度),将每个参数从16位浮点数压缩至4-8位,显存占用减少50%-75%,推理质量损失通常在5%以内70% 相似待验证GGUF格式的Q4_K_M是最主流的平衡选择,困惑度损失通常低于1%;Q8_0几乎无精度损失但文件体积是Q4的两倍67% 相似已验证GGUF量化格式(如Q4_K_M)通过将权重精度从32位浮点压缩到4位整数,通常只带来约1-5%的性能损失66% 相似待验证Qwen 2.5 7B使用4组GQA配置,推理时KV Cache体积相比MHA减少约75%62% 相似已验证Q4量化将每个权重参数从16位压缩到4位,理论上可将模型体积缩小约75%62% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/778810API
curl https://kongchang.com/api/v1/knowledge/claims/778810MCP
get_claim(id=778810)