待验证50% 置信事实精确时间
LLM-as-a-Judge方法最初由LMSYS在其Chatbot Arena中推广
1
来源数
50%
置信度
长期有效
时效性
2026/9/8
首次发现
来源
涉及实体
相关事实
待验证LLM as Judge是利用一个独立裁判LLM评判主模型输出质量的技术,评判维度包括安全性、相关性、事实一致性68% 相似已验证LLM-as-a-Judge是目前最流行的自动化评估方法,使用一个大模型来判断另一个大模型输出的质量67% 相似待验证一些团队引入LLM-as-Judge方式,用另一个模型评估Agent输出质量以形成自动化质量闭环66% 相似已验证LLM-as-a-judge模式即用一个能力更强的模型来评判另一个模型的输出质量,降低评测成本但引入评判模型自身的偏见问题64% 相似待验证LLM-as-a-Judge是由Zheng等人在2023年系统化提出的评估范式,利用能力更强的模型对被测模型输出进行打分或排序63% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/876175API
curl https://kongchang.com/api/v1/knowledge/claims/876175MCP
get_claim(id=876175)