Unverified60% confidenceFactExact time
LLM-as-a-Judge是由Zheng等人在2023年系统化提出的评估范式,利用能力更强的模型对被测模型输出进行打分或排序
2
Sources
60%
Confidence
Long-term
Relevance
7/16/2026
First Seen
Sources
Related Claims
UnverifiedLLM as Judge由Lianmin Zheng等人在MT-Bench论文(2023)中系统提出,核心思路是用独立大语言模型对另一模型输出进行打分以替代人工标注82% similarUnverified「LLM-as-Judge」范式最早在2023年被系统性提出,利用大语言模型本身的评估能力对生成内容进行质量打分79% similarVerifiedLLM-as-a-Judge是目前最流行的自动化评估方法,使用一个大模型来判断另一个大模型输出的质量77% similarVerifiedLLM-as-a-judge模式即用一个能力更强的模型来评判另一个模型的输出质量,降低评测成本但引入评判模型自身的偏见问题77% similarUnverifiedLLM-as-Judge方法由Zheng et al.在MT-Bench论文中系统验证,使用独立语言模型对目标模型输出进行多维度打分,但存在位置偏见和自我中心偏见75% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/526467API
curl https://kongchang.com/api/v1/knowledge/claims/526467MCP
get_claim(id=526467)