待验证50% 置信注意事项精确时间
无参考的LLM打分虽然方便,但可能系统性地偏离专家判断
1
来源数
50%
置信度
长期有效
时效性
2026/9/12
首次发现
来源
涉及实体
相关事实
待验证研究显示经典自动化指标和无参考的LLM-as-a-Judge方法在大规模专家判断下都被证明是不可靠的74% 相似待验证自动化指标(如BLEU、COMET、chrF)与人类判断的相关性有限,在评估语气和细微含义时尤其容易失真,应作为辅助而非主要依据70% 相似待验证LLM给出的是最安全的答案而非最好的答案,有价值的思考往往需要主动偏离AI的默认建议68% 相似待验证应将LLM定位为能力增强工具而非专家替代品,尤其在计算机体系结构这种容错率极低的领域需保持批判性信任68% 相似待验证当LLM表现不佳时,很多时候不是模型能力不足,而是指令本身不够清晰,应把模型当作聪明但不了解任务背景的助手68% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/911457API
curl https://kongchang.com/api/v1/knowledge/claims/911457MCP
get_claim(id=911457)