Unverified50% confidenceFactTime unknown
Pure Transformer architectures see inference costs grow quadratically with sequence length
1
Sources
50%
Confidence
Medium-term (~90 days)
Relevance
7/2/2026
First Seen
Valid until: 9/30/2026
Sources
Related Claims
VerifiedTransformer架构的自注意力机制在处理长序列时面临二次方复杂度的计算开销,上下文长度翻倍则计算量增长四倍75% similarUnverifiedTransformer的KV Cache随序列长度呈二次方增长,导致长上下文推理对GPU显存的非线性消耗69% similarUnverified标准Transformer的单次前向传播等价于固定深度的计算图,其表达能力受限于TC^0复杂度类,但通过多步推理可接近图灵完备的计算能力67% similarUnverified研究表明(Dettmers et al., 2022),Transformer模型中特定隐藏维度会在所有token和层中持续出现异常大激活值,模型超过6.7B参数时现象更显著64% similarUnverified在神经网络推理中Softmax、LayerNorm等对数值范围敏感的操作极易因FP16有限的指数位引发上溢或下溢,误差在Transformer多层堆叠中累积放大60% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/56400API
curl https://kongchang.com/api/v1/knowledge/claims/56400MCP
get_claim(id=56400)