待验证50% 置信事实精确时间
2024年研究者提出将模型的隐藏状态设计为可在测试时通过梯度下降更新的小模型,以解决Transformer长上下文计算复杂度过高的问题,同时保持RNN线性复杂度的优势
1
来源数
50%
置信度
长期有效
时效性
2026/9/11
首次发现
来源
涉及实体
相关事实
待验证研究表明(Dettmers et al., 2022),Transformer模型中特定隐藏维度会在所有token和层中持续出现异常大激活值,模型超过6.7B参数时现象更显著75% 相似待验证近期研究ShortGPT发现Transformer模型中间层的隐藏状态之间往往存在高度余弦相似性,这些冗余层可被安全移除而对性能影响较小72% 相似已验证Transformer克服了RNN/LSTM架构因顺序计算导致的长距离依赖衰减问题,同时天然支持并行计算68% 相似待验证Transformer 模型存在'远端衰减'(Lost in the Middle)现象,对位于上下文中段、距离当前生成位置较远的内容关注度会系统性下降68% 相似待验证斯坦福大学2023年的研究将Transformer在处理超长上下文时对中间位置信息遗忘率显著高于首尾位置的现象命名为'Lost in the Middle'问题67% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/907374API
curl https://kongchang.com/api/v1/knowledge/claims/907374MCP
get_claim(id=907374)