LLM-as-Judge
使用语言模型作为裁判对AI输出进行评分的范式,已被多项研究证实与人类评估具有较高相关性,但存在位置偏见(倾向于给排在前面的选项更高评分)和奉承偏见(倾向于认可权威来源输出)等问题。
Core Facts
Timeline (last 90 days)
当前主流评估方式如 MT-Bench、AlpacaEval 以及 LLM-as-Judge 都存在循环依赖和评分偏差的风险
输出质量门控的常见应对策略包括基于规则的启发式检测、使用LLM-as-Judge实时打分、以及对比新旧模型响应差异的Shadow Mode
将多条标准拆成独立的提示词调用可消除标准之间的相互干扰,降低交叉污染,但成本更高
重写一个提示词中的某条标准会导致同一提示词里其他标准的通过率波动5-10个百分点
主观性判断标准(如内容是否全面)在LLM评审中几乎是随机的,而事实性检查(如X是否存在)基本不翻转
级联策略先用单次调用过滤明确通过/失败的案例,只对不确定区间记录做多次采样,可在精度和成本间取得平衡
在推理后端中,temperature设为0并固定seed并不能保证确定性输出,结果仍会翻转
评估基准(Eval)是一套系统化的测试集与评分机制,评分可基于规则或采用LLM-as-Judge方式
由于智能体输出往往是开放式文本,Evals通常需要结合基于规则的检查、人工标注黄金答案对比和LLM-as-Judge打分等多种手段
Agent评测需应对非确定性输出,通常结合规则匹配、LLM-as-Judge和人工标注多种方式
14 more timeline events
All Facts (20)
智能体评估的主流方案包括LLM-as-Judge、轨迹匹配和结果验证
90%VerifiedLLM-as-Judge方法利用GPT-4等大语言模型作为裁判对Agent输出质量进行自动化评分
90%VerifiedLLM-as-a-Judge方法存在位置偏差、冗长偏差和自我偏好偏差等已知系统性偏差
80%VerifiedLLM-as-Judge方法与人类专家评分的一致性可达80%以上
80%VerifiedLLM-as-Judge方法论最早由UC Berkeley等机构在2023年系统提出
80%VerifiedLLM-as-a-judge模式即用一个能力更强的模型来评判另一个模型的输出质量,降低评测成本但引入评判模型自身的偏见问题
65%VerifiedGPT-4级别的模型作为Judge时,其评判结果与人类专家的一致性超过80%
65%Unverified基于规则的确定性评估框架相比LLM-as-Judge方法,在可重复性和可解释性方面具有优势,每条规则都是二元判断,不受评估模型本身偏差的影响
80%UnverifiedAI模型A/B测试业界通常采用基于规则的自动评估、LLM-as-Judge方法以及人工标注的黄金数据集对比三种评估框架
80%UnverifiedAI Agent评估领域正在经历从人工标注到LLM-as-Judge再到主动对抗性测试的三代技术演进
65%Unverified一些团队引入LLM-as-Judge方式,用另一个模型评估Agent输出质量以形成自动化质量闭环
60%UnverifiedLLM-as-a-Judge范式最初用于评估生成式AI输出质量,现被应用于简历-职位匹配等复杂推理判断场景
60%UnverifiedMLflow的评估框架采用了LLM-as-Judge范式,用一个强模型来评判另一个模型的输出
60%Unverified当前主流评估方式如 MT-Bench、AlpacaEval 以及 LLM-as-Judge 都存在循环依赖和评分偏差的风险
50%Unverified输出质量门控的常见应对策略包括基于规则的启发式检测、使用LLM-as-Judge实时打分、以及对比新旧模型响应差异的Shadow Mode
50%Unverified主观性判断标准(如内容是否全面)在LLM评审中几乎是随机的,而事实性检查(如X是否存在)基本不翻转
50%Unverified在推理后端中,temperature设为0并固定seed并不能保证确定性输出,结果仍会翻转
50%Unverified级联策略先用单次调用过滤明确通过/失败的案例,只对不确定区间记录做多次采样,可在精度和成本间取得平衡
50%Unverified将多条标准拆成独立的提示词调用可消除标准之间的相互干扰,降低交叉污染,但成本更高
50%Unverified重写一个提示词中的某条标准会导致同一提示词里其他标准的通过率波动5-10个百分点
50%