待验证60% 置信事实时间未知
Transformer的KV Cache随序列长度呈二次方增长,导致长上下文推理对GPU显存的非线性消耗
2
来源数
60%
置信度
长期有效
时效性
2026/5/31
首次发现
来源
Claude Code Sub-Agent:多智能体协作提升开发效率实战指南
bilibiliisomoes
涉及实体
相关事实
已验证Transformer架构的自注意力机制在处理长序列时面临二次方复杂度的计算开销,上下文长度翻倍则计算量增长四倍75% 相似待验证在Transformer模型推理过程中,KV Cache(键值缓存)会随对话增长不断膨胀,导致注意力分数分布越来越平坦,模型难以精准聚焦当前任务相关信息71% 相似待验证研究表明(Dettmers et al., 2022),Transformer模型中特定隐藏维度会在所有token和层中持续出现异常大激活值,模型超过6.7B参数时现象更显著70% 相似待验证Transformer 中任意两个位置之间的信息传递路径长度恒为1,从根本上克服了 RNN 在长序列上因梯度消失导致的遗忘问题69% 相似已验证Transformer克服了RNN/LSTM架构因顺序计算导致的长距离依赖衰减问题,同时天然支持并行计算69% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/3356API
curl https://kongchang.com/api/v1/knowledge/claims/3356MCP
get_claim(id=3356)