待验证60% 置信事实精确时间
注意力机制的计算量与序列长度的平方成正比,将上下文翻倍意味着计算量增加四倍
2
来源数
60%
置信度
长期有效
时效性
2026/7/13
首次发现
来源
智谱GLM-5.2发布:国产开源模型首次跨入主力门槛
bilibili冶承w2026/6/22
相关事实
待验证Transformer注意力机制的计算量随序列长度平方增长,早期语言模型上下文窗口上限约4000个token75% 相似待验证标准Transformer自注意力计算量随序列长度平方增长,50万token的注意力计算量约为4096token的15000倍72% 相似待验证Transformer注意力机制中的矩阵乘法和Softmax运算占据推理总算力的70%以上,ASIC可实现3至10倍的能效提升66% 相似待验证选择性重计算由Korthikanti等人在2022年的Megatron-LM论文中系统研究,仅对注意力激活值做重计算可在额外计算开销不超过10%的条件下接近全量重计算的显存节省63% 相似待验证蒙特卡洛方法的收敛速度为O(1/√N),精度每提高一个数量级需要样本量增加百倍63% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/501410API
curl https://kongchang.com/api/v1/knowledge/claims/501410MCP
get_claim(id=501410)