[
KongchangAI
]
Feed
Entities
Podcasts
Deep Dives
Developers
About
Get CLI
中文
Concept
LLM裁判 / 模型评估器
LLM-as-Judge
使用语言模型作为裁判对AI输出进行评分的范式,已被多项研究证实与人类评估具有较高相关性,但存在位置偏见(倾向于给排在前面的选项更高评分)和奉承偏见(倾向于认可权威来源输出)等问题。
Source Articles
长时运行AI Agent的7大核心组件设计指南
Jul 21