待验证50% 置信观点精确时间
主流基准测试题目在互联网上已被广泛讨论,模型训练数据中可能存在对题目的记忆,导致基准分数高估模型在真实未见任务上的能力
1
来源数
50%
置信度
长期有效
时效性
2026/7/6
首次发现
来源
GPT-5.5 Codex推理令牌聚集现象解析:性能退化的成因与应对
hackernewshackernews2026/7/4
相关事实
待验证传统大模型训练高度依赖人工标注数据和外部语料收集,这些步骤通常是制约迭代速度的瓶颈79% 相似待验证OpenAI在InstructGPT论文中证明,少量高质量人类偏好数据对模型对齐的贡献远超大规模无监督训练75% 相似已验证基准测试面临污染(Contamination)风险,若训练数据中包含测试题目或近似变体,模型高分可能部分源于背题而非真实能力75% 相似待验证2024年多项研究发现部分模型在标准基准上的优秀表现源于训练数据中混入了基准测试题目本身(数据污染)73% 相似待验证可利用大模型基于领域文档自动生成合成训练数据来构造问答对,通常需要数千至数万对训练样本才能取得显著效果73% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/123359API
curl https://kongchang.com/api/v1/knowledge/claims/123359MCP
get_claim(id=123359)