Lost in the Middle
Lost in the Middle 是大型语言模型(LLM)领域的一个研究概念,指模型在处理长文本上下文时,对位于输入序列中间位置的信息表现出注意力减弱、利用率降低的现象。该概念由相关学术研究提出,揭示了模型倾向于更有效地处理上下文首尾部分的信息,而对中间部分的关键内容存在忽略倾向,对长上下文理解能力评估具有重要参考意义。
Timeline (last 90 days)
Lost in the Middle现象最早由斯坦福大学Nelson F. Liu等人在2023年的论文中系统验证
当关键信息被放置在长文本的中间位置时,模型的检索和推理准确率会显著下降,而放在开头或结尾的信息则能被较好地利用
大语言模型存在 'lost in the middle' 问题,即模型对上下文中间位置的信息关注度显著低于首尾位置
LLM存在'Lost in the Middle'现象,即模型对上下文开头和结尾的信息关注度高,而对中间部分的信息容易忽略
研究表明当上下文过长时,模型对中间部分信息的注意力会显著下降,即"Lost in the Middle"现象
研究表明大语言模型在处理长文本时存在显著的「中间遗忘」(Lost in the Middle)现象,对输入文本开头和结尾的信息记忆较好,但对中间部分的信息关注度明显下降
大语言模型在长上下文中会出现'Lost in the Middle'现象,最初任务目标在注意力机制中的权重会被稀释(Liu et al., 2023)
斯坦福大学2023年发表了研究论文《Lost in the Middle》,实验证明当关键信息被放置在长上下文的中间位置时,模型的检索准确率会大幅下降
Transformer架构存在「Lost in the Middle」效应,模型对对话开头和结尾的内容记忆较好,但中间部分容易丢失
当前主流模型的上下文窗口已扩展至100K甚至200K tokens,但仍面临Lost in the Middle问题
1 more timeline events