待验证50% 置信基准精确时间
通过--quantization quark_mxfp4,SGLang在加载时将NVFP4权重解量化并重新量化为MXFP4,在MiniMax-M2.7、GLM-5.1等模型上GSM8K准确率恢复达97.5%-100.2%
1
来源数
50%
置信度
中期 (~90 天)
时效性
2026/9/5
首次发现
有效期至:2026/12/4
来源
涉及实体
相关事实
已验证GGUF量化格式(如Q4_K_M)通过将权重精度从32位浮点压缩到4位整数,通常只带来约1-5%的性能损失71% 相似待验证GGUF 量化命名中 Q4_K_M 表示 4 位量化、使用 K-Quant 分组量化方法的中等精度(Medium)变体70% 相似待验证Q4_K_XL方案中MoE层使用MXFP4,其余层压缩到Q8_0,在top-1%预测一致性上达到96% same69% 相似待验证Qwen 2.5 7B使用4组GQA配置,推理时KV Cache体积相比MHA减少约75%67% 相似待验证GPTQ、AWQ、SqueezeLLM等量化方法在4-bit精度下仍能保持接近原始模型95%以上的性能66% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/860553API
curl https://kongchang.com/api/v1/knowledge/claims/860553MCP
get_claim(id=860553)