待验证50% 置信事实精确时间
标准自注意力机制的计算复杂度与上下文长度的平方成正比(O(n²)),上下文从100K扩展到1M理论上计算量增加100倍
1
来源数
50%
置信度
长期有效
时效性
2026/8/30
首次发现
来源
涉及实体
相关事实
待验证注意力机制的计算量与序列长度的平方成正比,将上下文翻倍意味着计算量增加四倍78% 相似待验证蒙特卡洛方法的收敛速度为O(1/√N),精度每提高一个数量级需要样本量增加百倍74% 相似待验证选择性重计算由Korthikanti等人在2022年的Megatron-LM论文中系统研究,仅对注意力激活值做重计算可在额外计算开销不超过10%的条件下接近全量重计算的显存节省69% 相似待验证Transformer注意力机制的计算量随序列长度平方增长,早期语言模型上下文窗口上限约4000个token66% 相似待验证Transformer注意力机制中的矩阵乘法和Softmax运算占据推理总算力的70%以上,ASIC可实现3至10倍的能效提升65% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/822578API
curl https://kongchang.com/api/v1/knowledge/claims/822578MCP
get_claim(id=822578)