Unverified50% confidenceBenchmarkExact time
Zheng等人2023年发表的MT-Bench论文及多项后续研究证实,裁判模型的评分与人类专家评估具有80%以上的相关性
1
Sources
50%
Confidence
Long-term
Relevance
7/21/2026
First Seen
Sources
Related Claims
UnverifiedLLM-as-Judge方法由Zheng等人在2023年的MT-Bench论文中系统验证,与人类评估的一致性可达80%以上83% similarUnverified2023年加州大学伯克利分校发布的MT-Bench基准测试发现,顶级大模型作为评判者与人类专家判断一致性可达80%以上80% similarUnverified2023年学术界研究发现,顶级大模型作为评判者与人类专家的判断一致性可达80%以上76% similarVerifiedLLM-as-Judge方法与人类专家评分的一致性可达80%以上73% similarUnverified研究表明LLM裁判与人类专家的一致性在许多任务上可达80%以上71% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/583419API
curl https://kongchang.com/api/v1/knowledge/claims/583419MCP
get_claim(id=583419)