Unverified50% confidenceFactExact time
引入KV Cache可将自回归生成的计算复杂度从O(N²)降为O(N)
1
Sources
50%
Confidence
Long-term
Relevance
7/14/2026
First Seen
Sources
Related Claims
Unverified如果每次都重新计算所有历史token的K和V,计算复杂度为O(n²)79% similarUnverifiedL2算法相对于基向量系数位长β达到O(n⁴·β·(n+β))的位复杂度,在β=O(n)时相当于O(n⁶),而经典LLL约为O(n⁹)74% similarUnverifiedMLA通过低秩分解将KV Cache显存开销从O(n·d_model)压缩到O(n·d_latent),其中d_latent约为d_model的1/866% similarUnverified自注意力机制的QK^T计算对于序列长度n、隐藏维度d的模型需要O(n²d)次乘加运算66% similarUnverified大模型推理的自回归生成需要逐Token串行输出,生成N个Token需要N次前向传播63% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/503792API
curl https://kongchang.com/api/v1/knowledge/claims/503792MCP
get_claim(id=503792)