待验证50% 置信事实精确时间
Sliding Window Attention 被 Mistral 等模型采用,将每个 token 的注意力范围限制在固定窗口内
1
来源数
50%
置信度
长期有效
时效性
2026/7/11
首次发现
来源
Agentic MapReduce:AI Agent 实现全代码库分布式推理的关键架构
rss2026/7/1
相关事实
待验证滑动窗口注意力(如Mistral采用的方案)通过限制每个token只关注固定窗口内的历史,将复杂度从O(n²)降至O(n·w)80% 相似待验证滑动窗口注意力(SWA)由 Mistral AI 广泛采用,将注意力复杂度从 O(N²) 降至 O(N×W)73% 相似待验证超大上下文窗口通常依赖稀疏注意力机制、RoPE位置编码外推和分层缓存技术实现70% 相似待验证Muse Glimmer采用混合注意力机制:大部分层只关注2048 token的局部窗口,每隔四层做一次全局全注意力70% 相似待验证标准自注意力的计算复杂度为序列长度的平方,实现百万Token上下文需引入稀疏注意力、滑动窗口注意力及KV Cache压缩等技术70% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/482921API
curl https://kongchang.com/api/v1/knowledge/claims/482921MCP
get_claim(id=482921)