待验证60% 置信事实精确时间
Needle-in-a-Haystack测试将关键信息随机插入超长文档不同位置,测试模型能否准确找到,是检验长上下文能力的标准压力测试
2
来源数
60%
置信度
长期有效
时效性
2026/7/9
首次发现
来源
国产AI外网被赞内网被批:三重错位揭示评价割裂真相
bilibili跟陈博士学AI2026/7/4
相关事实
待验证大海捞针测试将无关的目标句随机插入长文本不同位置,通过询问模型绘制「位置×上下文长度」的二维热力图,呈现检索成功率77% 相似待验证长上下文检索准确率通过Needle-in-a-Haystack测试衡量模型在超长文档中精准定位关键信息的能力74% 相似已验证Needle in a Haystack测试最初由Greg Kamradt于2023年底提出,用于评估模型在长上下文中精确检索特定信息的能力73% 相似待验证检验微调对比研究是否存在偏差的标准是查看超参数搜索章节,确认每个对照组都有独立的学习率调优记录及足够多的随机种子重复71% 相似待验证极简模式适合作为压力测试和全链路测试的选择,用于测试文件写入吞吐量、并发数量、每秒IO等性能指标70% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/339585API
curl https://kongchang.com/api/v1/knowledge/claims/339585MCP
get_claim(id=339585)