待验证50% 置信事实精确时间
近期研究ShortGPT发现Transformer模型中间层的隐藏状态之间往往存在高度余弦相似性,这些冗余层可被安全移除而对性能影响较小
1
来源数
50%
置信度
长期有效
时效性
2026/9/11
首次发现
来源
涉及实体
相关事实
待验证研究表明(Dettmers et al., 2022),Transformer模型中特定隐藏维度会在所有token和层中持续出现异常大激活值,模型超过6.7B参数时现象更显著75% 相似待验证Transformer模型存在位置偏差,对中间位置信息的检索能力尤其薄弱,即lost in the middle问题72% 相似待验证Transformer 模型存在'远端衰减'(Lost in the Middle)现象,对位于上下文中段、距离当前生成位置较远的内容关注度会系统性下降72% 相似待验证Transformer模型中首尾几层对量化更敏感,中间层冗余度更高,注意力层和前馈网络层对量化的容忍度不同72% 相似待验证当前Transformer架构在处理分散于超长上下文中的隐式约束时存在根本性局限,导致修改代码时引入隐蔽bug72% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/893768API
curl https://kongchang.com/api/v1/knowledge/claims/893768MCP
get_claim(id=893768)