[控场AI]
基准大海捞针测试 / NIAH

Needle in a Haystack

由Greg Kamradt于2023年提出的大模型长上下文评测方法,通过在长文本不同位置插入目标句并检测模型检索能力,绘制二维热力图评估模型在不同上下文位置的检索成功率

核心事实

时间轴 (近 90 天)

9月12日

大海捞针测试将无关的目标句随机插入长文本不同位置,通过询问模型绘制「位置×上下文长度」的二维热力图,呈现检索成功率

待验证50%
8月31日

单跳大海捞针、多年前的污染基准、少样本上下文学习这三类评测场景对压缩和稀疏方法最为友好,几乎能让任何方法表现优异

待验证50%
8月31日

Needle in a Haystack测试由Greg Kamradt于2023年底提出,最初使用Paul Graham的文章作为填充文本,'针'是一句关于旧金山最好披萨店的陈述

待验证50%
8月31日

在单跳大海捞针任务中,关键的KV对在注意力分数上天然突出,压缩方法几乎不可能丢掉它,使其对压缩方法过于'友好'

待验证50%
8月31日

Needle in a Haystack测试由Greg Kamradt于2023年底提出,最初使用Paul Graham的文章作为填充文本

待验证50%
8月30日

单跳大海捞针、污染基准、少样本上下文学习这三类评测任务对压缩和稀疏方法最为友好,大多数在滑动窗口注意力下就能通过

待验证50%
8月30日

Needle in a Haystack测试最初由Greg Kamradt于2023年底提出,用于评估模型在长上下文中精确检索特定信息的能力

已验证80%

全部知识事实 (7)

来源文章