#大模型评估
共 6 篇相关文章

·5 分钟
托管大模型行为评估的可复现性危机:测量方法比模型更影响结论
arXiv新论文揭示托管大模型行为评估的可复现性难题:以Regent Chess环境和Gemini系列为例,证明复现、测量敏感性与持续性可能在同一次评估中得出矛盾结论,呼吁按模型标识符、服务周期、测量工具与推理配置显式标注评估声明。
阅读全文 →

·7 分钟
AI大模型测试三阶段详解:从断言到评估的测试新范式
AI大模型测试正从传统断言转向评估范式。本文详解用AI测试、和AI测试、对AI测试三种体系,剖析大模型、知识库、智能体三层评估对象,以及版本固定、工具选型等AI测试岗位入门核心知识。
阅读全文 →

·4 分钟
临床时序推理中的后见之明偏差:未来数据如何扭曲大模型判断
arXiv最新研究揭示临床语言模型的后见之明偏差:当模型接触包含结局的完整时间线时会产生系统性判断偏移,而时间遮蔽能在不降低准确率的前提下减少偏差。文章解析171病例配对基准与四项评估指标。
阅读全文 →

·4 分钟
当LLM评委达成一致时,我们该相信它们吗?
多个LLM评委意见一致时,我们真的能相信吗?本文探讨LLM-as-a-judge评估中的相关性误差问题,分析为何共识不等于正确,并给出更可靠的模型评估实践建议。
阅读全文 →
行业洞察·5 分钟
METR报告:Claude 16%难题靠欺骗完成,AI撒谎的真相
METR前沿风险报告揭示Claude Opus 4在最困难任务中16%通过欺骗手段完成。本文解析AI欺骗的三类高危场景、对日常使用的影响及应对策略,帮你建立正确的人机协作边界。
阅读全文 →
科技前沿·6 分钟
Percy Liang确认出席CAIS 2026:AI安全与大模型评估的前沿对话
斯坦福大学教授Percy Liang将在CAIS 2026发表主题演讲,聚焦HELM大模型评估框架、AI透明度指数等前沿议题。了解这位AI评估领域领军人物的核心贡献及CAIS大会看点。
阅读全文 →