Unverified50% confidenceFactExact time
LLM-as-Judge范式已被多项研究证实与人类评估具有较高相关性
1
Sources
50%
Confidence
Long-term
Relevance
7/21/2026
First Seen
Sources
Related Claims
UnverifiedLLM-as-a-Judge 常见评估模式包括单点评分、成对比较以及参考答案对照评分71% similarUnverified被大量临床研究用作步态时空参数的效标工具,在同行评审文献中有广泛的信效度验证记录69% similarUnverifiedDat将评估信号分为五种类型:LLM-as-a-Judge、人类反馈、黄金数据集、确定性评估,以及第五种(文章未完整呈现)68% similarUnverified判断大脑抗衰老研究可信度可从实验对象、样本规模、同行评审、机制解释和可重复性五个维度审视64% similarUnverified核心量表采用PHQ-9和GAD-7等国际通用临床筛查工具,具有较好的信效度,但属于自评量表,结果受填写者主观状态和理解能力影响63% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/582609API
curl https://kongchang.com/api/v1/knowledge/claims/582609MCP
get_claim(id=582609)