待验证50% 置信事实精确时间
密集注意力层需要完整的KV Cache,而线性层则依赖隐状态
1
来源数
50%
置信度
长期有效
时效性
2026/9/11
首次发现
来源
涉及实体
相关事实
待验证标准自注意力的计算复杂度为序列长度的平方,实现百万Token上下文需引入稀疏注意力、滑动窗口注意力及KV Cache压缩等技术73% 相似待验证研究表明注意力层主要负责信息的路由和聚合,而MLP层更像是知识的存储库,负责非线性变换和信息的深度加工73% 相似待验证混合架构(线性注意力 + 标准注意力)相比纯全注意力在长上下文任务中效率更高,但在某些需要精确全局依赖的推理任务中线性注意力可能略逊于标准注意力72% 相似待验证对于L层、H个注意力头、每头维度为d的模型,缓存n个token需要的显存为2×L×H×d×n×精度字节数71% 相似待验证K3将线性注意力层与标准注意力层混合使用,以在精度与效率之间寻求平衡71% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/899614API
curl https://kongchang.com/api/v1/knowledge/claims/899614MCP
get_claim(id=899614)