Unverified50% confidenceFactExact time
Transformer架构的自注意力机制计算复杂度为O(n²),当n从8K增长到128K时理论计算量增长256倍
1
Sources
50%
Confidence
Long-term
Relevance
9/11/2026
First Seen
Sources
Related Entities
Related Claims
Unverified自注意力机制的计算复杂度和内存占用均为O(n²),输入从1K增加到10K tokens时计算量增加约100倍74% similarUnverified从1.0mp到2.5mp的分辨率提升,其时间成本增长通常远超2.5倍,因为自注意力计算复杂度与token数量的平方成正比70% similarUnverified液态卷积的计算复杂度与序列长度呈线性关系O(n),而非自注意力的平方关系O(n²),处理128K Tokens时计算量仅为注意力层的约1/100068% similarUnverified处理128K Token序列所需的注意力矩阵大小是8K Token序列的256倍67% similarUnverified将上下文从128K扩展到1M,理论计算量会增加约60倍66% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/894961API
curl https://kongchang.com/api/v1/knowledge/claims/894961MCP
get_claim(id=894961)