待验证50% 置信基准精确时间
研究发现反事实输入的忠实度得分仅比事实输入低0.05分(在1-5分量表上),差异几乎可以忽略不计
1
来源数
50%
置信度
长期有效
时效性
2026/9/11
首次发现
来源
涉及实体
相关事实
待验证测评题量与信度存在权衡:低于30题的『快测』因抽样不足信度偏低,但200题以上的专业量表易产生答题疲劳导致后半段随意作答,60-120题是兼顾信度与完成质量的区间76% 相似待验证在正负样本极度不均衡的场景(如欺诈检测)中,单纯看准确率作为评估指标毫无意义75% 相似待验证品种比例低于5%的检测结果基本不具参考意义,可能是数据库比对噪声,选购时应关注报告是否明确标注比例置信区间而非单纯给出百分比75% 相似待验证2023年的TruthfulQA基准测试显示,即便是当时最强的模型,在需要精确事实判断的问题上准确率也未超过60%74% 相似待验证在事实性评估任务上模型评判者准确率仍显著低于人类专家,但在风格、连贯性等主观维度已接近人类评审员间一致性水平73% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/893450API
curl https://kongchang.com/api/v1/knowledge/claims/893450MCP
get_claim(id=893450)