待验证60% 置信事实时间未知
Transformer的KV Cache随序列长度呈二次方增长,导致长上下文推理对GPU显存的非线性消耗
2
来源数
60%
置信度
长期有效
时效性
2026/5/31
首次发现
来源
Claude Code Sub-Agent:多智能体协作提升开发效率实战指南
bilibiliisomoes
涉及实体
相关事实
已验证Transformer架构的自注意力机制在处理长序列时面临二次方复杂度的计算开销,上下文长度翻倍则计算量增长四倍75% 相似待验证传统 Transformer 推理中每个请求的 KV Cache 需预先分配连续显存空间,因序列长度不可预知常按最大长度预分配,导致显存碎片浪费,实际利用率有时不足 50%73% 相似待验证Transformer自注意力机制的计算成本随上下文长度呈平方级增长,且存在Lost in the Middle效应导致模型对窗口中部信息提取能力弱于头尾72% 相似待验证研究表明(Dettmers et al., 2022),Transformer模型中特定隐藏维度会在所有token和层中持续出现异常大激活值,模型超过6.7B参数时现象更显著70% 相似待验证当前主流的Transformer架构模型(如GPT系列、Claude、Gemini等)在处理长上下文时存在注意力衰减问题,对话越长对早期内容的记忆越不稳定70% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/3356API
curl https://kongchang.com/api/v1/knowledge/claims/3356MCP
get_claim(id=3356)