Scaling Law
大模型领域的核心理论,表明随着模型参数量、数据量和计算量的增加,模型性能会呈现可预测的幂律提升
Core Facts
Scaling Law(规模定律)由OpenAI研究员于2020年发现,指模型参数量、训练数据量和计算量按特定比例增长时模型性能会可预测地提升
Scaling Law最早由OpenAI研究员在2020年的论文《Scaling Laws for Neural Language Models》中系统性地提出和量化
OpenAI提出的Scaling Law揭示模型性能随参数量、训练数据量和计算量的增加呈现可预测的幂律式提升
Timeline (last 90 days)
通过更大参数、更多数据、更强算力来提升模型能力(Scaling Law)依然是各大实验室的核心策略之一
Scaling Law由OpenAI研究员Jared Kaplan等人在2020年正式提出,指出模型性能与参数量、数据量、计算量之间存在幂律关系
2024年以来多方面证据暗示纯粹依靠Pre-training Scaling可能正在遭遇收益递减,高质量文本可获取量已接近互联网存量天花板
纽约大学认知科学家Gary Marcus指出,当前基于规模扩展(Scaling Law)的路径可能存在根本性的天花板
Kaplan等人在2020年提出的神经网络缩放定律表明模型性能与数据量、参数量、计算量之间存在幂律关系,模型交叉熵损失L与参数量N满足L ∝ N^(-α)
Scaling Law是针对特定架构、目标函数、数据集观察到的经验关系,而非物理定律,改变任一因素就会得到不同的缩放曲线
多家研究机构指出人类产生的高质量公开文本可能在2026-2028年被用尽
Scaling Law研究发现模型性能(以交叉熵损失衡量)与模型参数量、数据集大小、计算量之间存在可预测的幂律关系
自2024年以来,多项研究和产业实践显示单纯增加参数量带来的收益正在递减,训练成本呈指数增长而基准测试分数提升趋于平缓
2020年OpenAI研究团队发表Scaling Law论文,指出模型性能与参数规模、数据量、计算量之间存在可预测的幂律关系
7 more timeline events
All Facts (20)
Scaling Law(规模定律)由OpenAI研究员于2020年发现,指模型参数量、训练数据量和计算量按特定比例增长时模型性能会可预测地提升
90%VerifiedScaling Law最早由OpenAI研究员在2020年的论文《Scaling Laws for Neural Language Models》中系统性地提出和量化
80%VerifiedOpenAI提出的Scaling Law揭示模型性能随参数量、训练数据量和计算量的增加呈现可预测的幂律式提升
65%VerifiedScaling Law 最早由 Kaplan 等人于2020年在语言模型研究中系统量化,指出模型性能与参数量、数据量、计算量之间存在幂律关系
65%Verified进入2025年,业界普遍观察到Scaling Law的边际收益在递减,单纯增大模型规模带来的能力提升已不如早期显著
65%UnverifiedScaling Law描述了Transformer模型性能与参数量、数据量、计算量之间存在可预测的幂律关系
90%Unverified规模定律由OpenAI研究员Jared Kaplan等人于2020年系统论证,核心发现是语言模型交叉熵损失与模型参数量、训练数据量、计算量之间存在幂律关系
60%Unverified2020年OpenAI研究人员Kaplan等人发表论文首次系统性揭示语言模型性能与模型参数量、训练数据量、计算量之间存在可预测的幂律关系(Scaling Law)
60%Unverified通过更大参数、更多数据、更强算力来提升模型能力(Scaling Law)依然是各大实验室的核心策略之一
50%UnverifiedScaling Law由OpenAI研究员Jared Kaplan等人在2020年正式提出,指出模型性能与参数量、数据量、计算量之间存在幂律关系
50%Unverified2024年以来多方面证据暗示纯粹依靠Pre-training Scaling可能正在遭遇收益递减,高质量文本可获取量已接近互联网存量天花板
50%Unverified纽约大学认知科学家Gary Marcus指出,当前基于规模扩展(Scaling Law)的路径可能存在根本性的天花板
50%UnverifiedKaplan等人在2020年提出的神经网络缩放定律表明模型性能与数据量、参数量、计算量之间存在幂律关系,模型交叉熵损失L与参数量N满足L ∝ N^(-α)
50%UnverifiedScaling Law是针对特定架构、目标函数、数据集观察到的经验关系,而非物理定律,改变任一因素就会得到不同的缩放曲线
50%Unverified自2024年以来,多项研究和产业实践显示单纯增加参数量带来的收益正在递减,训练成本呈指数增长而基准测试分数提升趋于平缓
50%UnverifiedScaling Law研究发现模型性能(以交叉熵损失衡量)与模型参数量、数据集大小、计算量之间存在可预测的幂律关系
50%Unverified2020年OpenAI研究团队发表Scaling Law论文,指出模型性能与参数规模、数据量、计算量之间存在可预测的幂律关系
50%Unverified规模定律(Scaling Law)指模型能力随参数量和训练数据量增长呈现可预测的规律性提升
50%Unverified2020年Kaplan等人确立的扩展定律表明模型性能与参数量、数据量和计算量之间存在幂律关系
50%Unverified在推理阶段投入更多计算资源能带来性能增益(测试时计算扩展理论),且增益存在明显收益递减区间
50%