待验证50% 置信事实精确时间
自注意力机制允许模型在处理每个Token时同时看到输入序列中所有其他Token的信息,注意力矩阵计算复杂度为O(n²)
1
来源数
50%
置信度
长期有效
时效性
2026/7/18
首次发现
来源
相关事实
已验证自注意力机制让每个位置直接与序列中任意其他位置交互,计算复杂度为O(n²)85% 相似待验证标准注意力机制中,Query矩阵与Key矩阵做矩阵乘法得到n×n注意力分数矩阵,计算复杂度为O(n²·d)85% 相似待验证Self-Attention机制计算复杂度与序列长度平方成正比(O(n²)),一个128K token请求的原生注意力计算量约为4K token请求的1024倍79% 相似待验证自注意力机制的计算复杂度随序列长度呈近似二次方增长,序列长度为n时注意力矩阵计算量正比于n²79% 相似待验证标准注意力机制具有O(n²)的显存开销,行数2000时需计算约2000×2000的注意力矩阵78% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/551084API
curl https://kongchang.com/api/v1/knowledge/claims/551084MCP
get_claim(id=551084)