待验证50% 置信事实精确时间
标准Softmax注意力在极长序列上存在注意力湮没(Attention Sink)问题,催生了Sliding Window Attention、RoPE外推、ALiBi等改进方案
1
来源数
50%
置信度
长期有效
时效性
2026/7/10
首次发现
来源
GLM-5.2发布:开源编程能力首次逼近闭源旗舰模型
bilibili五里墩茶社2026/6/22
相关事实
待验证Transformer架构的注意力机制中,序列长度增加时早期token的注意力得分在softmax归一化后被后续token稀释,形成注意力沉没效应78% 相似待验证流式处理的解决方案包括因果注意力掩码、chunked attention和look-ahead缓冲76% 相似已验证Multi-Head Latent Attention(MLA)是DeepSeek-V2提出的注意力机制75% 相似待验证标准Attention的显存消耗随序列长度平方增长,Flash Attention将其压缩到线性增长74% 相似待验证新内核为滑动窗口注意力(SWA)层提供双输入支持,并引入 attention sinks 机制74% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/453428API
curl https://kongchang.com/api/v1/knowledge/claims/453428MCP
get_claim(id=453428)