待验证50% 置信事实精确时间
一个拥有1800行测试用例的评估套件长期稳定在97%的聚合通过率,但其中64行多语言切片的通过率只有61%
1
来源数
50%
置信度
长期有效
时效性
2026/10/2
首次发现
来源
涉及实体
相关事实
待验证在1700个容易用例加100个困难多语言用例的情形下,即便困难用例全军覆没一半,聚合通过率也可能只从97%掉到93%左右73% 相似待验证运行10次测试置信区间宽度约±31%,100次收窄至±10%,400次进一步收窄至±5%,推荐关键测试用例至少运行20-50次69% 相似待验证测试的准确率数据在n=100样本量下误差约为±8-10个百分点(基于95%置信水平的二项分布置信区间)69% 相似待验证86%的准确率意味着仍存在14%的误差空间,Articos更适合作为早期验证和方向性判断手段,而非替代真实用户测试69% 相似待验证消融分析显示片段范式微调在测试集带来+5.29分提升,而用2000检索词替换前4500转录词仅带来+1.55分提升68% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/968363API
curl https://kongchang.com/api/v1/knowledge/claims/968363MCP
get_claim(id=968363)