Unverified50% confidenceFactExact time
标准自注意力机制的计算复杂度与上下文长度的平方成正比(O(n²)),上下文从100K扩展到1M理论上计算量增加100倍
1
Sources
50%
Confidence
Long-term
Relevance
8/30/2026
First Seen
Sources
Related Entities
Related Claims
Unverified注意力机制的计算量与序列长度的平方成正比,将上下文翻倍意味着计算量增加四倍78% similarUnverified蒙特卡洛方法的收敛速度为O(1/√N),精度每提高一个数量级需要样本量增加百倍74% similarUnverified选择性重计算由Korthikanti等人在2022年的Megatron-LM论文中系统研究,仅对注意力激活值做重计算可在额外计算开销不超过10%的条件下接近全量重计算的显存节省69% similarUnverifiedTransformer注意力机制的计算量随序列长度平方增长,早期语言模型上下文窗口上限约4000个token66% similarUnverifiedTransformer注意力机制中的矩阵乘法和Softmax运算占据推理总算力的70%以上,ASIC可实现3至10倍的能效提升65% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/822578API
curl https://kongchang.com/api/v1/knowledge/claims/822578MCP
get_claim(id=822578)