Unverified50% confidenceBenchmarkExact time
在GIST层面的测试中,模型对历史决策、路径名的理解准确率达到98%
1
Sources
50%
Confidence
Medium-term (~90 days)
Relevance
7/15/2026
First Seen
Valid until: 10/13/2026
Sources
Related Claims
UnverifiedAI-Q在Benchmark测试中处理复杂逻辑的准确率达到94%63% similarUnverified校准性指模型表达的置信度与实际准确率之间的一致程度63% similarUnverifiedRAGAS、TruLens等评估框架可自动对推理步骤的忠实度打分61% similarUnverified长上下文检索准确率通过Needle-in-a-Haystack测试衡量模型在超长文档中精准定位关键信息的能力60% similarUnverified校准性(Calibration)指模型表达的置信度与实际准确率之间的一致程度,是评估AI模型质量的核心指标之一59% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/517923API
curl https://kongchang.com/api/v1/knowledge/claims/517923MCP
get_claim(id=517923)