Unverified50% confidenceFactExact time
128K长度的序列所需的注意力计算量是4K长度序列的1024倍
1
Sources
50%
Confidence
Long-term
Relevance
8/12/2026
First Seen
Sources
Related Claims
Unverified序列长度为4096时,N×N注意力矩阵在FP16精度下仅此一项就消耗约64MB显存76% similarUnverified128K上下文窗口的注意力矩阵规模是32K窗口的16倍73% similarUnverified170k tokens场景下,注意力得分矩阵在BF16精度下约需54GB显存(170000×170000×2字节)73% similarUnverified视频生成中自注意力的计算量与token数的平方成正比,一段4秒720p 24fps视频经VAE编码和patch化后token总数可达数万乃至十余万70% similarVerified以70B参数模型、FP16精度、32层注意力头为例,单条200K长度请求的KV Cache约需80-120GB显存,远超单张A100 GPU的80GB显存上限70% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/734748API
curl https://kongchang.com/api/v1/knowledge/claims/734748MCP
get_claim(id=734748)