Unverified80% confidenceFactTime unknown
LLM-as-Judge方法由Zheng等人在2023年的MT-Bench论文中系统验证,与人类评估的一致性可达80%以上
1
Sources
80%
Confidence
Long-term
Relevance
5/31/2026
First Seen
Sources
MLflow实战教程:GenAI追踪+经典ML调优的全栈MLOps指南
youtubeNeuralNine
Related Entities
Related Claims
UnverifiedZheng等人2023年发表的MT-Bench论文及多项后续研究证实,裁判模型的评分与人类专家评估具有80%以上的相关性83% similarVerifiedLLM-as-Judge方法与人类专家评分的一致性可达80%以上80% similarUnverified2023年加州大学伯克利分校发布的MT-Bench基准测试发现,顶级大模型作为评判者与人类专家判断一致性可达80%以上78% similarUnverified研究表明经过良好校准的LLM裁判与人工标注的一致性可达80%以上71% similarUnverified2024年的多项研究表明,LLM裁判与人类专家的一致率通常在70%-85%之间69% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/7290API
curl https://kongchang.com/api/v1/knowledge/claims/7290MCP
get_claim(id=7290)