已验证80% 置信事实精确时间
Needle in a Haystack测试最初由Greg Kamradt于2023年底提出,用于评估模型在长上下文中精确检索特定信息的能力
4
来源数
80%
置信度
长期有效
时效性
2026/8/30
首次发现
来源
涉及实体
相关事实
待验证Needle-in-a-Haystack测试将关键信息随机插入超长文档不同位置,测试模型能否准确找到,是检验长上下文能力的标准压力测试73% 相似待验证DetectGPT由Mitchell等人于2023年提出,通过对原文进行多次随机扰动并比较扰动前后的对数概率变化来判断文本来源64% 相似待验证长上下文检索准确率通过Needle-in-a-Haystack测试衡量模型在超长文档中精准定位关键信息的能力63% 相似待验证传统渗透测试是针对某个时间点、特定形态系统的一张快照59% 相似待验证SWE-bench测试样本取自真实GitHub仓库的历史Issue,评分标准是能否通过仓库原有的完整测试套件59% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/823644API
curl https://kongchang.com/api/v1/knowledge/claims/823644MCP
get_claim(id=823644)