Unverified50% confidenceFactExact time
自注意力机制的QK^T计算对于序列长度n、隐藏维度d的模型需要O(n²d)次乘加运算
1
Sources
50%
Confidence
Long-term
Relevance
8/5/2026
First Seen
Sources
Related Claims
Unverified自注意力机制允许模型在单次计算中直接建立序列中任意两个位置元素之间的语义依赖关系,解决了长距离依赖问题并支持并行计算67% similarUnverified引入KV Cache可将自回归生成的计算复杂度从O(N²)降为O(N)66% similarUnverifiedKV Cache技术允许模型在自回归生成时复用历史token的注意力Key-Value矩阵计算结果,使长对话推理延迟从O(n²)降低至接近线性66% similarUnverified决定大模型推理性能的是VRAM(显存)而非系统内存,当模型权重超出VRAM容量时推理速度会从数十TPS断崖式跌至个位数65% similarUnverified前向KL散度D(p||q)倾向于让q覆盖p的所有可能性(mode-covering),是变分推断和监督学习中最常用的形式65% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/691082API
curl https://kongchang.com/api/v1/knowledge/claims/691082MCP
get_claim(id=691082)