待验证50% 置信事实精确时间
Naive-N0.5-Flash 原生支持 100 万 token 上下文,且未采用全注意力机制
1
来源数
50%
置信度
长期有效
时效性
2026/9/28
首次发现
来源
涉及实体
相关事实
已验证FlashAttention通过重新设计注意力计算的内存访问模式,将显存占用从与序列长度平方成正比降低为线性关系62% 相似待验证Self-Attention机制计算复杂度与序列长度平方成正比(O(n²)),一个128K token请求的原生注意力计算量约为4K token请求的1024倍62% 相似待验证大模型中存在注意力汇聚(Attention Sink)现象,即序列最开头的几个 token 往往保持较高的注意力权重61% 相似待验证Muse Glimmer采用混合注意力机制:大部分层只关注2048 token的局部窗口,每隔四层做一次全局全注意力60% 相似待验证标准Attention计算的显存占用和带宽消耗均为O(N²),FlashAttention将显存占用降至O(N)60% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/957115API
curl https://kongchang.com/api/v1/knowledge/claims/957115MCP
get_claim(id=957115)