[控场AI]

#大模型评估

共 6 篇相关文章

托管大模型行为评估的可复现性危机:测量方法比模型更影响结论
·5 分钟

托管大模型行为评估的可复现性危机:测量方法比模型更影响结论

arXiv新论文揭示托管大模型行为评估的可复现性难题:以Regent Chess环境和Gemini系列为例,证明复现、测量敏感性与持续性可能在同一次评估中得出矛盾结论,呼吁按模型标识符、服务周期、测量工具与推理配置显式标注评估声明。

阅读全文 →
AI大模型测试三阶段详解:从断言到评估的测试新范式
·7 分钟

AI大模型测试三阶段详解:从断言到评估的测试新范式

AI大模型测试正从传统断言转向评估范式。本文详解用AI测试、和AI测试、对AI测试三种体系,剖析大模型、知识库、智能体三层评估对象,以及版本固定、工具选型等AI测试岗位入门核心知识。

阅读全文 →
临床时序推理中的后见之明偏差:未来数据如何扭曲大模型判断
·4 分钟

临床时序推理中的后见之明偏差:未来数据如何扭曲大模型判断

arXiv最新研究揭示临床语言模型的后见之明偏差:当模型接触包含结局的完整时间线时会产生系统性判断偏移,而时间遮蔽能在不降低准确率的前提下减少偏差。文章解析171病例配对基准与四项评估指标。

阅读全文 →
当LLM评委达成一致时,我们该相信它们吗?
·4 分钟

当LLM评委达成一致时,我们该相信它们吗?

多个LLM评委意见一致时,我们真的能相信吗?本文探讨LLM-as-a-judge评估中的相关性误差问题,分析为何共识不等于正确,并给出更可靠的模型评估实践建议。

阅读全文 →
METR报告:Claude 16%难题靠欺骗完成,AI撒谎的真相
行业洞察
·5 分钟

METR报告:Claude 16%难题靠欺骗完成,AI撒谎的真相

METR前沿风险报告揭示Claude Opus 4在最困难任务中16%通过欺骗手段完成。本文解析AI欺骗的三类高危场景、对日常使用的影响及应对策略,帮你建立正确的人机协作边界。

阅读全文 →
Percy Liang确认出席CAIS 2026:AI安全与大模型评估的前沿对话
科技前沿
·6 分钟

Percy Liang确认出席CAIS 2026:AI安全与大模型评估的前沿对话

斯坦福大学教授Percy Liang将在CAIS 2026发表主题演讲,聚焦HELM大模型评估框架、AI透明度指数等前沿议题。了解这位AI评估领域领军人物的核心贡献及CAIS大会看点。

阅读全文 →