待验证50% 置信事实精确时间
LLM 评估(LLM Eval)通常依赖以模型评模型的方式,或使用人工标注的黄金数据集来衡量输出的准确性、安全性与风格一致性
1
来源数
50%
置信度
长期有效
时效性
2026/9/18
首次发现
来源
涉及实体
相关事实
待验证LLM评估工程上通常借助RAGAS、DeepEval等框架,结合人工标注或用另一个LLM充当裁判来打分76% 相似待验证该研究使用「LLM作为裁判」的评估方式,只要本地模型胜出或与专有模型打平就计为一次胜利75% 相似已验证LLM-as-a-Judge是目前最流行的自动化评估方法,使用一个大模型来判断另一个大模型输出的质量75% 相似待验证LLM可通过分析输出token的对数概率分布、思维链末尾自我评估、温度采样统计答案分布熵值等手段近似估计决策置信度75% 相似待验证LLM as Judge是利用一个独立裁判LLM评判主模型输出质量的技术,评判维度包括安全性、相关性、事实一致性72% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/932567API
curl https://kongchang.com/api/v1/knowledge/claims/932567MCP
get_claim(id=932567)