[KongchangAI]
Benchmark大海捞针测试 / NIAH

Needle in a Haystack

由Greg Kamradt于2023年提出的大模型长上下文评测方法,通过在长文本不同位置插入目标句并检测模型检索能力,绘制二维热力图评估模型在不同上下文位置的检索成功率

Core Facts

Timeline (last 90 days)

Sep 12

大海捞针测试将无关的目标句随机插入长文本不同位置,通过询问模型绘制「位置×上下文长度」的二维热力图,呈现检索成功率

Unverified50%
Aug 31

单跳大海捞针、多年前的污染基准、少样本上下文学习这三类评测场景对压缩和稀疏方法最为友好,几乎能让任何方法表现优异

Unverified50%
Aug 31

Needle in a Haystack测试由Greg Kamradt于2023年底提出,最初使用Paul Graham的文章作为填充文本,'针'是一句关于旧金山最好披萨店的陈述

Unverified50%
Aug 31

在单跳大海捞针任务中,关键的KV对在注意力分数上天然突出,压缩方法几乎不可能丢掉它,使其对压缩方法过于'友好'

Unverified50%
Aug 31

Needle in a Haystack测试由Greg Kamradt于2023年底提出,最初使用Paul Graham的文章作为填充文本

Unverified50%
Aug 30

单跳大海捞针、污染基准、少样本上下文学习这三类评测任务对压缩和稀疏方法最为友好,大多数在滑动窗口注意力下就能通过

Unverified50%
Aug 30

Needle in a Haystack测试最初由Greg Kamradt于2023年底提出,用于评估模型在长上下文中精确检索特定信息的能力

Verified80%

All Facts (7)

Source Articles