Unverified50% confidenceFactTime unknown
大海捞针测试将无关的目标句随机插入长文本不同位置,通过询问模型绘制「位置×上下文长度」的二维热力图,呈现检索成功率
1
Sources
50%
Confidence
Long-term
Relevance
9/12/2026
First Seen
Sources
上下文退化基准测试:主流大模型的长文本短板
githubkyleaoconnell22
Related Entities
Related Claims
UnverifiedNeedle-in-a-Haystack测试将关键信息随机插入超长文档不同位置,测试模型能否准确找到,是检验长上下文能力的标准压力测试77% similarUnverified理想的基准测试应固定模型、工具和任务分布,只让轨迹长度作为单一变量变化68% similarUnverified在关键路径上引入校验和、断言、冗余计算等校验机制能够尽早发现异常并保留排查线索68% similarUnverified跑分排名不等于所有场景的实际表现,具体任务仍需具体测试68% similarUnverified实验测试横跨六个异构基准(heterogeneous benchmarks)67% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/917853API
curl https://kongchang.com/api/v1/knowledge/claims/917853MCP
get_claim(id=917853)