Scaling Law
大模型领域的核心理论,表明随着模型参数量、数据量和计算量的增加,模型性能会呈现可预测的幂律提升
核心事实
时间轴 (近 90 天)
头部AI厂商正将竞争重心从训练时的参数规模转向推理时的效率与经济性,降价是争夺市场份额以构建生态护城河的策略
Scaling Law研究发现在算力和数据按比例增加时模型性能持续提升,但提升幅度是否衰减仍存在争议
通过更大参数、更多数据、更强算力来提升模型能力(Scaling Law)依然是各大实验室的核心策略之一
Scaling Law由OpenAI研究员Jared Kaplan等人在2020年正式提出,指出模型性能与参数量、数据量、计算量之间存在幂律关系
2024年以来多方面证据暗示纯粹依靠Pre-training Scaling可能正在遭遇收益递减,高质量文本可获取量已接近互联网存量天花板
纽约大学认知科学家Gary Marcus指出,当前基于规模扩展(Scaling Law)的路径可能存在根本性的天花板
Kaplan等人在2020年提出的神经网络缩放定律表明模型性能与数据量、参数量、计算量之间存在幂律关系,模型交叉熵损失L与参数量N满足L ∝ N^(-α)
潜空间推理可能使AI从更大规模转向更优架构,与业界对Scaling Law边际收益递减的反思密切相关
Scaling Law是针对特定架构、目标函数、数据集观察到的经验关系,而非物理定律,改变任一因素就会得到不同的缩放曲线
多家研究机构指出人类产生的高质量公开文本可能在2026-2028年被用尽
还有 10 条时间轴事件
全部知识事实 (20)
Scaling Law(规模定律)由OpenAI研究员于2020年发现,指模型参数量、训练数据量和计算量按特定比例增长时模型性能会可预测地提升
90%已验证OpenAI在2020年提出了Scaling Law(缩放定律),揭示模型性能与参数量、数据量和计算量之间存在幂律关系
80%已验证Scaling Law最早由OpenAI研究员在2020年的论文《Scaling Laws for Neural Language Models》中系统性地提出和量化
80%已验证规模定律由OpenAI研究员Jared Kaplan等人于2020年系统论证,核心发现是语言模型交叉熵损失与模型参数量、训练数据量、计算量之间存在幂律关系
75%已验证OpenAI提出的Scaling Law揭示模型性能随参数量、训练数据量和计算量的增加呈现可预测的幂律式提升
65%已验证Scaling Law 最早由 Kaplan 等人于2020年在语言模型研究中系统量化,指出模型性能与参数量、数据量、计算量之间存在幂律关系
65%已验证从GPT-1到GPT-3,模型架构本身并没有发生根本性变化,主要提升来自参数规模的扩大和训练数据的增加,印证了规模定律(Scaling Law)
65%已验证多家研究机构指出人类产生的高质量公开文本可能在2026-2028年被用尽
75%待验证Scaling Law描述了Transformer模型性能与参数量、数据量、计算量之间存在可预测的幂律关系
90%待验证Google翻译团队2006年的论文展示了类似于后来被称为Scaling Law的现象——随着数据量和计算量增加,模型质量呈现规律性提升
85%待验证Kaplan等人在2020年提出的神经网络缩放定律表明模型性能与数据量、参数量、计算量之间存在幂律关系,模型交叉熵损失L与参数量N满足L ∝ N^(-α)
60%待验证潜空间推理可能使AI从更大规模转向更优架构,与业界对Scaling Law边际收益递减的反思密切相关
60%待验证2020年OpenAI研究人员Kaplan等人发表论文首次系统性揭示语言模型性能与模型参数量、训练数据量、计算量之间存在可预测的幂律关系(Scaling Law)
60%待验证头部AI厂商正将竞争重心从训练时的参数规模转向推理时的效率与经济性,降价是争夺市场份额以构建生态护城河的策略
50%待验证Scaling Law研究发现在算力和数据按比例增加时模型性能持续提升,但提升幅度是否衰减仍存在争议
50%待验证通过更大参数、更多数据、更强算力来提升模型能力(Scaling Law)依然是各大实验室的核心策略之一
50%待验证Scaling Law由OpenAI研究员Jared Kaplan等人在2020年正式提出,指出模型性能与参数量、数据量、计算量之间存在幂律关系
50%待验证2024年以来多方面证据暗示纯粹依靠Pre-training Scaling可能正在遭遇收益递减,高质量文本可获取量已接近互联网存量天花板
50%待验证纽约大学认知科学家Gary Marcus指出,当前基于规模扩展(Scaling Law)的路径可能存在根本性的天花板
50%待验证Scaling Law是针对特定架构、目标函数、数据集观察到的经验关系,而非物理定律,改变任一因素就会得到不同的缩放曲线
50%