待验证50% 置信事实精确时间
LLM-as-a-Judge 常见评估模式包括单点评分、成对比较以及参考答案对照评分
1
来源数
50%
置信度
长期有效
时效性
2026/8/10
首次发现
来源
相关事实
待验证Dat将评估信号分为五种类型:LLM-as-a-Judge、人类反馈、黄金数据集、确定性评估,以及第五种(文章未完整呈现)74% 相似待验证LLM-as-Judge范式已被多项研究证实与人类评估具有较高相关性71% 相似待验证评价体系需看'差评是否可见'而非仅看总评分,只显示好评或评分普遍9.8以上的平台往往做了评价过滤,参考价值低68% 相似待验证选择注明基于标准化常模(如CBCL、SDQ、Conners、韦氏儿童量表WISC)的测评,而非商家自研的'心理测试',标准化量表有百分位或T分数参照,自研题库通常无信效度验证65% 相似待验证结果报告提供数值和参考范围,但口碑普遍反映解读偏基础,对于异常结果的后续行动指导有限,多数用户仍需带着结果咨询医生才能获得实质性建议63% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/724014API
curl https://kongchang.com/api/v1/knowledge/claims/724014MCP
get_claim(id=724014)