待验证50% 置信事实精确时间
大模型中存在注意力汇聚(Attention Sink)现象,即序列最开头的几个 token 往往保持较高的注意力权重
1
来源数
50%
置信度
长期有效
时效性
2026/8/25
首次发现
来源
涉及实体
相关事实
待验证标准Softmax注意力在极长序列上存在注意力湮没(Attention Sink)问题,催生了Sliding Window Attention、RoPE外推、ALiBi等改进方案76% 相似待验证标准Attention的显存消耗随序列长度平方增长,Flash Attention将其压缩到线性增长72% 相似待验证新内核为滑动窗口注意力(SWA)层提供双输入支持,并引入 attention sinks 机制72% 相似待验证多头注意力在不同的低维子空间中并行执行多次注意力操作,通常8头或16头71% 相似待验证标准自注意力的计算复杂度为序列长度的平方,实现百万Token上下文需引入稀疏注意力、滑动窗口注意力及KV Cache压缩等技术71% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/798530API
curl https://kongchang.com/api/v1/knowledge/claims/798530MCP
get_claim(id=798530)