Unverified95% confidenceFactTime unknown
滑动窗口注意力将标准Transformer O(n²)的复杂度降至O(n·w),但模型无法直接看到窗口之外的信息
1
Sources
95%
Confidence
Long-term
Relevance
5/31/2026
First Seen
Sources
Qwen3.6本地部署实战:35B模型逆向LTE调制解调器击败Claude
bilibili比特光锥_BightCone
Related Entities
Related Claims
Unverified滑动窗口注意力(如Mistral采用的方案)通过限制每个token只关注固定窗口内的历史,将复杂度从O(n²)降至O(n·w)82% similarUnverified滑动窗口注意力将注意力计算复杂度从O(n²)降至O(n·w),使长文本显存开销线性化78% similarVerified标准Transformer架构的自注意力机制计算复杂度为O(n²)76% similarUnverified滑动窗口注意力将计算复杂度从O(n²)降至O(n×w),是Mistral模型家族的核心创新之一75% similarUnverifiedMLP Mixer 摒弃了 Transformer 中计算复杂度为 O(n²) 的自注意力机制,通过两种全连接层(沿通道维度和位置维度混合特征)将计算复杂度降至线性74% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/13915API
curl https://kongchang.com/api/v1/knowledge/claims/13915MCP
get_claim(id=13915)