待验证50% 置信事实精确时间
Transformer架构的自注意力机制计算复杂度为O(n²),n从8K增长到128K时理论计算量增长256倍
1
来源数
50%
置信度
长期有效
时效性
2026/9/11
首次发现
来源
涉及实体
相关事实
待验证128K长度的序列所需的注意力计算量是4K长度序列的1024倍64% 相似待验证序列长度为4096时,N×N注意力矩阵在FP16精度下仅此一项就消耗约64MB显存62% 相似待验证Llama-3.1-8B 等模型基于 Transformer 解码器堆叠构建,通常包含32个decoder层,单层参数量约2.5亿,FP16精度下单层约占500MB显存62% 相似待验证开发者假设随着总参数量从105M增长到206M再到402M,只要保持激活切片大小不变,解码速度就能维持恒定62% 相似待验证即便采用INT8量化和优化注意力机制,24GB显存显卡在面对2.5mp加12秒的生成任务时仍可能显存不足61% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/895435API
curl https://kongchang.com/api/v1/knowledge/claims/895435MCP
get_claim(id=895435)