待验证95% 置信事实时间未知
滑动窗口注意力将标准Transformer O(n²)的复杂度降至O(n·w),但模型无法直接看到窗口之外的信息
1
来源数
95%
置信度
长期有效
时效性
2026/5/31
首次发现
来源
Qwen3.6本地部署实战:35B模型逆向LTE调制解调器击败Claude
bilibili比特光锥_BightCone
涉及实体
相关事实
待验证滑动窗口注意力(如Mistral采用的方案)通过限制每个token只关注固定窗口内的历史,将复杂度从O(n²)降至O(n·w)82% 相似待验证滑动窗口注意力将注意力计算复杂度从O(n²)降至O(n·w),使长文本显存开销线性化78% 相似已验证标准Transformer架构的自注意力机制计算复杂度为O(n²)76% 相似待验证滑动窗口注意力将计算复杂度从O(n²)降至O(n×w),是Mistral模型家族的核心创新之一75% 相似待验证MLP Mixer 摒弃了 Transformer 中计算复杂度为 O(n²) 的自注意力机制,通过两种全连接层(沿通道维度和位置维度混合特征)将计算复杂度降至线性74% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/13915API
curl https://kongchang.com/api/v1/knowledge/claims/13915MCP
get_claim(id=13915)