待验证50% 置信事实精确时间
128K长度的序列所需的注意力计算量是4K长度序列的1024倍
1
来源数
50%
置信度
长期有效
时效性
2026/8/12
首次发现
来源
相关事实
待验证序列长度为4096时,N×N注意力矩阵在FP16精度下仅此一项就消耗约64MB显存76% 相似待验证128K上下文窗口的注意力矩阵规模是32K窗口的16倍73% 相似待验证170k tokens场景下,注意力得分矩阵在BF16精度下约需54GB显存(170000×170000×2字节)73% 相似待验证视频生成中自注意力的计算量与token数的平方成正比,一段4秒720p 24fps视频经VAE编码和patch化后token总数可达数万乃至十余万70% 相似已验证以70B参数模型、FP16精度、32层注意力头为例,单条200K长度请求的KV Cache约需80-120GB显存,远超单张A100 GPU的80GB显存上限70% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/734748API
curl https://kongchang.com/api/v1/knowledge/claims/734748MCP
get_claim(id=734748)