Unverified50% confidenceBenchmarkExact time
通过--quantization quark_mxfp4,SGLang在加载时将NVFP4权重解量化并重新量化为MXFP4,在MiniMax-M2.7、GLM-5.1等模型上GSM8K准确率恢复达97.5%-100.2%
1
Sources
50%
Confidence
Medium-term (~90 days)
Relevance
9/5/2026
First Seen
Valid until: 12/4/2026
Sources
Related Entities
Related Claims
VerifiedGGUF量化格式(如Q4_K_M)通过将权重精度从32位浮点压缩到4位整数,通常只带来约1-5%的性能损失71% similarUnverifiedGGUF 量化命名中 Q4_K_M 表示 4 位量化、使用 K-Quant 分组量化方法的中等精度(Medium)变体70% similarUnverifiedQ4_K_XL方案中MoE层使用MXFP4,其余层压缩到Q8_0,在top-1%预测一致性上达到96% same69% similarUnverifiedQwen 2.5 7B使用4组GQA配置,推理时KV Cache体积相比MHA减少约75%67% similarUnverifiedGPTQ、AWQ、SqueezeLLM等量化方法在4-bit精度下仍能保持接近原始模型95%以上的性能66% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/860553API
curl https://kongchang.com/api/v1/knowledge/claims/860553MCP
get_claim(id=860553)