Unverified50% confidenceFactExact time
Sliding Window Attention 被 Mistral 等模型采用,将每个 token 的注意力范围限制在固定窗口内
1
Sources
50%
Confidence
Long-term
Relevance
7/11/2026
First Seen
Sources
Agentic MapReduce:AI Agent 实现全代码库分布式推理的关键架构
rss7/1/2026
Related Claims
Unverified滑动窗口注意力(如Mistral采用的方案)通过限制每个token只关注固定窗口内的历史,将复杂度从O(n²)降至O(n·w)80% similarUnverified滑动窗口注意力(SWA)由 Mistral AI 广泛采用,将注意力复杂度从 O(N²) 降至 O(N×W)73% similarUnverified超大上下文窗口通常依赖稀疏注意力机制、RoPE位置编码外推和分层缓存技术实现70% similarUnverifiedMuse Glimmer采用混合注意力机制:大部分层只关注2048 token的局部窗口,每隔四层做一次全局全注意力70% similarUnverified标准自注意力的计算复杂度为序列长度的平方,实现百万Token上下文需引入稀疏注意力、滑动窗口注意力及KV Cache压缩等技术70% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/482921API
curl https://kongchang.com/api/v1/knowledge/claims/482921MCP
get_claim(id=482921)