#LLM评估
共 3 篇相关文章

·5 分钟
LLM评审结果为何反复横跳?拆解LLM-as-Judge的稳定性陷阱
用 LLM 作为评审官检查文本时,同样输入却反复给出不同结果?本文拆解 LLM-as-Judge 的稳定性陷阱,分析温度、提示词措辞、全部通过逻辑带来的噪声叠加,并给出拆分任务、多次投票等实用改进方案。
阅读全文 →

·4 分钟
Inspect:面向大语言模型评估的开源框架
Inspect 是一款面向大语言模型(LLM)评估的开源框架,旨在为模型能力评测提供标准化、可复现的基础设施。本文解析其定位、价值与适用场景,并客观说明信息局限。
阅读全文 →

·5 分钟
点赞失效?任务型LLM如何用物理结果闭环反馈
任务型LLM中用户点赞反馈为何不可靠?一位开发者分享了为工业维修诊断助手构建物理结果反馈闭环的实战方案,涵盖记忆去重、文本规范化与负样本记录等关键工程细节。
阅读全文 →