Unverified50% confidenceBenchmarkExact time
在Track B上,扁平RAG基线能检测出76%–97%的真实矛盾,但对16%–43%表层相似的安全草稿产生误报(具体比例取决于后端)
1
Sources
50%
Confidence
Long-term
Relevance
9/25/2026
First Seen
Sources
Related Entities
Related Claims
Unverified86%的准确率意味着仍存在14%的误差空间,Articos更适合作为早期验证和方向性判断手段,而非替代真实用户测试69% similarUnverified在完全未被触碰的152题测试子集上,锚定混合检索为42.11%,规划引导方法仅36.84%67% similarUnverified报告同时给出中位数KLD和99.9%分位KLD两个数值,前者反映典型情况,后者捕捉极端长尾错误67% similarUnverified聚合指标(如平均分)会掩盖长尾场景中的失败,当95%常规case表现优异时,剩余5%边缘案例的崩溃不会在总分上留下明显痕迹67% similarUnverifiedDeepSuite基准测试的误报率为44.9%,漏报率为1.2%67% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/949060API
curl https://kongchang.com/api/v1/knowledge/claims/949060MCP
get_claim(id=949060)