Unverified60% confidenceFactExact time
学术界多项研究表明GPT-4、LLaMA等主流模型在MMLU、HumanEval、GSM8K等榜单上的高分有相当比例来自训练集与测试集内容重叠
2
Sources
60%
Confidence
Long-term
Relevance
7/9/2026
First Seen
Sources
大模型跑分榜单的真相:实战能力才是真正护城河
bilibili卢菁博士_北大AI博士后7/7/2026
Related Claims
UnverifiedGPT-5在HumanEval、SWE-bench等主流编程基准测试上相比前代模型表现大幅提升79% similarUnverifiedGPT 系列、Llama 等模型的核心能力绝大部分来自预训练而非后续微调阶段77% similarUnverifiedGPT-5.3的自训练突破将自我评估机制扩展到了整个训练数据管道,不仅用于评估,训练材料本身也由模型生成73% similarUnverified训练阶段化方法包括GPT-4等模型采用的渐进式sequence length增长、Chinchilla论文启发的动态batch size调度、μP参数化的分层学习率缩放73% similarVerifiedDeepSeek的R1模型在多项基准测试中展现出与GPT-4o相当的推理能力,且训练成本据称仅为同级别美国模型的极小比例73% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/355048API
curl https://kongchang.com/api/v1/knowledge/claims/355048MCP
get_claim(id=355048)