Unverified50% confidenceFactExact time
滑动窗口注意力将计算复杂度从O(n²)降至O(n×w),是Mistral模型家族的核心创新之一
1
Sources
50%
Confidence
Long-term
Relevance
7/20/2026
First Seen
Sources
Related Claims
Unverified滑动窗口注意力(如Mistral采用的方案)通过限制每个token只关注固定窗口内的历史,将复杂度从O(n²)降至O(n·w)83% similarUnverified滑动窗口注意力(SWA)由 Mistral AI 广泛采用,将注意力复杂度从 O(N²) 降至 O(N×W)82% similarUnverified滑动窗口注意力将标准Transformer O(n²)的复杂度降至O(n·w),但模型无法直接看到窗口之外的信息75% similarUnverifiedLongformer由Allen AI提出,采用滑动窗口局部注意力加全局注意力token的组合策略,将复杂度从O(n²)降至O(n)75% similarUnverified滑动窗口注意力将注意力计算复杂度从O(n²)降至O(n·w),使长文本显存开销线性化74% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/573151API
curl https://kongchang.com/api/v1/knowledge/claims/573151MCP
get_claim(id=573151)