Unverified50% confidenceFactExact time
DS Spark的Markov head采用Rank 256低秩矩阵实现顺序条件依赖,额外计算开销压缩在1%量级以内
1
Sources
50%
Confidence
Long-term
Relevance
7/10/2026
First Seen
Sources
DeepSeek推理提速85%:投机解码如何重塑AI速度竞赛
bilibili枫叶边城7/6/2026
Related Claims
UnverifiedQ4_K_M采用分组量化策略,将权重张量划分为64或256维子块并独立计算缩放因子与零点,能将困惑度损失控制在1–3%以内65% similarUnverified推理端优化技术包括量化、知识蒸馏和KV Cache,量化可将参数从32位或16位浮点压缩为8位甚至4位整数63% similarUnverifiedINT4量化将原本由65536个不同值(FP16)表示的权重压缩到仅16个离散级别61% similarUnverifiedMoE模型中'35B'指总参数量,每个token只激活少量Expert(通常2-4个),实际计算量可能仅相当于6-7B的Dense模型59% similarVerifiedQ4量化将每个权重参数从16位压缩到4位,理论上可将模型体积缩小约75%59% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/464867API
curl https://kongchang.com/api/v1/knowledge/claims/464867MCP
get_claim(id=464867)