Unverified50% confidenceFactExact time
LLM-as-a-Judge 常见评估模式包括单点评分、成对比较以及参考答案对照评分
1
Sources
50%
Confidence
Long-term
Relevance
8/10/2026
First Seen
Sources
Related Claims
UnverifiedDat将评估信号分为五种类型:LLM-as-a-Judge、人类反馈、黄金数据集、确定性评估,以及第五种(文章未完整呈现)74% similarUnverifiedLLM-as-Judge范式已被多项研究证实与人类评估具有较高相关性71% similarUnverified评价体系需看'差评是否可见'而非仅看总评分,只显示好评或评分普遍9.8以上的平台往往做了评价过滤,参考价值低68% similarUnverified选择注明基于标准化常模(如CBCL、SDQ、Conners、韦氏儿童量表WISC)的测评,而非商家自研的'心理测试',标准化量表有百分位或T分数参照,自研题库通常无信效度验证65% similarUnverified结果报告提供数值和参考范围,但口碑普遍反映解读偏基础,对于异常结果的后续行动指导有限,多数用户仍需带着结果咨询医生才能获得实质性建议63% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/724014API
curl https://kongchang.com/api/v1/knowledge/claims/724014MCP
get_claim(id=724014)