Unverified50% confidenceFactExact time
新内核为滑动窗口注意力(SWA)层提供双输入支持,并引入 attention sinks 机制
1
Sources
50%
Confidence
Long-term
Relevance
7/16/2026
First Seen
Sources
Related Claims
VerifiedMulti-Head Latent Attention(MLA)是DeepSeek-V2提出的注意力机制74% similarUnverified标准Softmax注意力在极长序列上存在注意力湮没(Attention Sink)问题,催生了Sliding Window Attention、RoPE外推、ALiBi等改进方案74% similarUnverified超大上下文窗口通常依赖稀疏注意力机制、RoPE位置编码外推和分层缓存技术实现72% similarUnverified滑动窗口注意力(SWA)由 Mistral AI 广泛采用,将注意力复杂度从 O(N²) 降至 O(N×W)71% similarUnverified上下文窗口扩展得益于ALiBi位置编码、RoPE的外推扩展、Flash Attention和Ring Attention等技术突破70% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/527873API
curl https://kongchang.com/api/v1/knowledge/claims/527873MCP
get_claim(id=527873)