Unverified50% confidenceBenchmarkExact time
2023年加州大学伯克利分校发布的MT-Bench基准测试发现,顶级大模型作为评判者与人类专家判断一致性可达80%以上
1
Sources
50%
Confidence
Long-term
Relevance
7/14/2026
First Seen
Sources
Related Claims
Unverified2023年学术界研究发现,顶级大模型作为评判者与人类专家的判断一致性可达80%以上84% similarUnverifiedZheng等人2023年发表的MT-Bench论文及多项后续研究证实,裁判模型的评分与人类专家评估具有80%以上的相关性80% similarUnverifiedLLM-as-Judge方法由Zheng等人在2023年的MT-Bench论文中系统验证,与人类评估的一致性可达80%以上78% similarVerifiedLLM-as-Judge方法与人类专家评分的一致性可达80%以上75% similarUnverified研究发现强大的LLM在评估开放式问答质量方面与人类评分者的一致性可达80%以上70% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/503741API
curl https://kongchang.com/api/v1/knowledge/claims/503741MCP
get_claim(id=503741)