待验证50% 置信事实精确时间
新内核为滑动窗口注意力(SWA)层提供双输入支持,并引入 attention sinks 机制
1
来源数
50%
置信度
长期有效
时效性
2026/7/16
首次发现
来源
相关事实
已验证Multi-Head Latent Attention(MLA)是DeepSeek-V2提出的注意力机制74% 相似待验证标准Softmax注意力在极长序列上存在注意力湮没(Attention Sink)问题,催生了Sliding Window Attention、RoPE外推、ALiBi等改进方案74% 相似待验证超大上下文窗口通常依赖稀疏注意力机制、RoPE位置编码外推和分层缓存技术实现72% 相似待验证滑动窗口注意力(SWA)由 Mistral AI 广泛采用,将注意力复杂度从 O(N²) 降至 O(N×W)71% 相似待验证上下文窗口扩展得益于ALiBi位置编码、RoPE的外推扩展、Flash Attention和Ring Attention等技术突破70% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/527873API
curl https://kongchang.com/api/v1/knowledge/claims/527873MCP
get_claim(id=527873)