待验证50% 置信事实精确时间
后续研究指出DPO在分布外样本上容易过度拟合偏好数据中的虚假相关性,且因缺乏显式奖励模型更难监测过度优化程度
1
来源数
50%
置信度
长期有效
时效性
2026/9/6
首次发现
来源
涉及实体
相关事实
已验证部分模型存在针对测试集过度优化的风险,导致榜单分数与真实场景表现出现偏差(Benchmark饱和)76% 相似已验证若用含测试集的全量数据计算均值和标准差,会导致预处理泄漏,使评估指标虚高,无法真实反映模型泛化能力74% 相似待验证模型跳过检索直接作答的过度自信在技术上被称为校准不足(miscalibration),即置信度与实际正确率存在系统性偏差73% 相似待验证若将验证集或测试集数据纳入 fit,会造成数据泄露,导致模型评估结果过于乐观72% 相似待验证部分厂商存在针对评测集过度优化(刷榜/benchmark contamination)的倾向,导致分数膨胀但泛化能力不足72% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/867158API
curl https://kongchang.com/api/v1/knowledge/claims/867158MCP
get_claim(id=867158)