Unverified50% confidenceFactExact time
「LLM-as-Judge」范式最早在2023年被系统性提出,利用大语言模型本身的评估能力对生成内容进行质量打分
1
Sources
50%
Confidence
Long-term
Relevance
8/14/2026
First Seen
Sources
Related Claims
UnverifiedLLM-as-a-Judge是由Zheng等人在2023年系统化提出的评估范式,利用能力更强的模型对被测模型输出进行打分或排序79% similarUnverifiedLLM as Judge由Lianmin Zheng等人在MT-Bench论文(2023)中系统提出,核心思路是用独立大语言模型对另一模型输出进行打分以替代人工标注75% similarUnverified2024年多项研究表明LLM存在显著的'自我一致性偏差',当被要求评估自己生成的内容时,模型倾向于给出过高评价70% similarVerifiedLLM-as-a-Judge是目前最流行的自动化评估方法,使用一个大模型来判断另一个大模型输出的质量69% similarVerified大型语言模型(LLM)本质上是概率性文本生成系统,通过预测下一个最可能出现的词来生成内容,而非真正'理解'职业前景或就业市场69% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/746899API
curl https://kongchang.com/api/v1/knowledge/claims/746899MCP
get_claim(id=746899)