待验证60% 置信事实精确时间
学术界多项研究表明GPT-4、LLaMA等主流模型在MMLU、HumanEval、GSM8K等榜单上的高分有相当比例来自训练集与测试集内容重叠
2
来源数
60%
置信度
长期有效
时效性
2026/7/9
首次发现
来源
大模型跑分榜单的真相:实战能力才是真正护城河
bilibili卢菁博士_北大AI博士后2026/7/7
相关事实
待验证GPT-5在HumanEval、SWE-bench等主流编程基准测试上相比前代模型表现大幅提升79% 相似待验证GPT 系列、Llama 等模型的核心能力绝大部分来自预训练而非后续微调阶段77% 相似待验证GPT-5.3的自训练突破将自我评估机制扩展到了整个训练数据管道,不仅用于评估,训练材料本身也由模型生成73% 相似待验证训练阶段化方法包括GPT-4等模型采用的渐进式sequence length增长、Chinchilla论文启发的动态batch size调度、μP参数化的分层学习率缩放73% 相似已验证DeepSeek的R1模型在多项基准测试中展现出与GPT-4o相当的推理能力,且训练成本据称仅为同级别美国模型的极小比例73% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/355048API
curl https://kongchang.com/api/v1/knowledge/claims/355048MCP
get_claim(id=355048)