Verified65% confidenceFactTime unknown
LLM-as-Judge方法利用GPT-4等大语言模型作为裁判对Agent输出质量进行自动化评分
3
Sources
65%
Confidence
Long-term
Relevance
6/1/2026
First Seen
Sources
Agent评估五维体系:AI产品经理面试必考题全解析
bilibili果果姐讲AI
Related Entities
Related Claims
UnverifiedLLM-as-Judge范式使用能力更强的大语言模型(如GPT-4o或Claude 3.5 Sonnet)对被评估模型的输出进行打分83% similarUnverifiedLLM-as-Judge使用另一个强力模型(如GPT-4)来评判输出质量,因其灵活性正在成为主流评估方式82% similarUnverifiedGPT-4等模型在作为评判者时会系统性地偏好特定位置的回答79% similarUnverified评测采用 GPT-5.5 担任 LLM 评审法官,配合人工品味评分的混合方式78% similarUnverifiedGPT-4级别的模型作为Judge时,其评判结果与人类专家的一致性超过80%74% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/24751API
curl https://kongchang.com/api/v1/knowledge/claims/24751MCP
get_claim(id=24751)