重新审视LLM扩展定律:如何选对Token/参数比

扩展定律需动态校准:提高Token/参数比以用小模型换取更低推理成本,才是生产级训练的经济最优解。
本文围绕大语言模型训练中"Token-per-Parameter Coverage"这一核心变量展开,指出经典扩展定律所追求的"训练算力最优"与实际部署中的"成本最优"之间存在根本性偏差。推理阶段的开销主要由参数量决定,因此用更多数据训练更小的模型——即适度"过度训练"——往往能在全生命周期内取得更优的经济性。这一逻辑解释了近期开源模型(如LLaMA系列)倾向于在远超Chinchilla最优点的数据量上继续训练的核心动因。文章同时指出,提高Token/参数比面临边际递减和高质量数据供给两大约束,合成数据与数据复用带来的质量风险也不容忽视。对从业者而言,核心启示在于:应将推理成本前置到训练决策中,并根据部署频率动态调整参数与数据的配比策略。
扩展定律为何需要重新校准
大语言模型的训练长期依赖所谓的"扩展定律"(Scaling Laws)来指导资源分配——在给定算力预算下,模型参数量与训练数据量应该如何搭配,才能获得最优性能。这篇来自Reddit技术社区的讨论聚焦于一个核心但常被忽视的变量:每参数覆盖的Token数(Token-per-Parameter Coverage),并提出当前主流的配比方式可能并非最优。
经典的扩展定律研究曾给出一个广为流传的经验值:模型参数与训练Token数应大致保持某个固定比例关系。然而随着模型规模、数据质量和训练目标的变化,这一"黄金比例"是否仍然成立,正受到越来越多的质疑。原始讨论的切入点正是:选对Token/参数比,比盲目堆砌参数或数据更能提升扩展效率。
Token-per-Parameter Coverage 的本质
所谓Token-per-Parameter Coverage,可以理解为平均每个模型参数在训练过程中"见过"多少Token。这个指标直接关系到两个关键的训练经济学问题:
算力的边际收益
在固定的训练算力(FLOPs)预算下,增加参数量和增加训练数据量是一对此消彼长的选择。参数越多,模型的表达能力越强,但如果训练数据不足,模型容易欠拟合、无法充分发挥参数潜力;反之,数据过多而参数不足,则会浪费宝贵的高质量语料,模型容量成为瓶颈。
这一权衡关系的量化基础来自2022年DeepMind发布的Chinchilla论文。该研究通过系统性实验提出,在计算最优(Compute-Optimal)条件下,模型参数量与训练Token数应大致保持1:20的比例——即每个参数对应约20个Token。这一结论直接挑战了此前GPT-3时代的主流做法:当时业界普遍倾向于将大多数算力投入模型规模扩张,而训练数据相对不足。Chinchilla定律的核心贡献在于将"计算最优"具体化为可操作的参数配比,使其成为此后模型设计的重要参考基准。然而需要注意的是,Chinchilla的实验规模有限,且其结论基于特定的数据集与训练设置,对于超大规模模型或特定领域应用是否仍然适用,目前仍存在争议。
推理成本的长期考量
值得深入讨论的是,训练阶段的"计算最优"并不等同于部署阶段的"成本最优"。一个参数更少、但用更多Token充分训练的模型,虽然在训练时看似"过度训练",却能在推理阶段显著降低成本——因为推理开销主要由参数量决定。这正是近年来业界倾向于训练更小、更"吃数据"模型的核心动因。
推理阶段的计算开销主要由两部分构成:模型参数加载到显存的内存带宽消耗(Memory-Bound推理),以及前向传播中的矩阵运算量。对于批量较小的在线推理场景,内存带宽往往是瓶颈,这意味着参数量直接决定每次推理的延迟与成本。以一个具体量级来感受:将模型参数从70B缩减到7B,推理所需显存和单次请求的计算量均下降约一个数量级,这在百万级日活的部署场景中意味着可观的算力节省。Meta的LLaMA系列和Mistral等模型的设计哲学均体现了这一取舍——用远超Chinchilla最优点的数据量换取更紧凑的参数规模,使模型能够在消费级GPU上流畅运行,从而大幅降低推理侧的总体拥有成本(TCO)。
为什么"过度训练"反而划算
传统扩展定律追求的是"训练算力最优",即在一次性训练预算下让损失最低。但真实世界中的模型要被部署、被调用数百万甚至数十亿次。当把推理成本纳入总体拥有成本(TCO)后,提高Token/参数比——也就是用相对更多的数据去训练相对更小的模型——往往是更经济的选择。
这一思路解释了为何近期许多开源模型选择在远超"计算最优点"的数据量上继续训练。更高的Token-per-Parameter Coverage意味着:
- 更小的模型体积,更低的显存占用和推理延迟
- 在同等性能下更友好的部署门槛
- 对高质量训练数据的更充分利用
实践中的权衡与挑战
提高Token/参数比并非没有代价。随着训练数据量不断增加,模型性能的提升会呈现边际递减趋势——每多训练一个Token带来的损失下降越来越小。因此,"选对"配比的关键,在于找到性能收益与训练成本之间的平衡点,而非一味追求极端。
此外,高质量数据的供给是另一个现实约束。当训练Token数持续攀升,可用的优质语料可能面临枯竭,数据重复使用或合成数据的引入又会带来新的质量与多样性问题。这意味着扩展定律的优化不能脱离数据工程的现实条件单独讨论。
合成数据的引入是应对优质语料枯竭的主要策略之一,但也带来了独特的风险。当模型在大量由其他模型生成的数据上训练时,可能出现"模型坍缩"(Model Collapse)现象——即模型的输出分布逐渐趋同、多样性下降,尾部知识逐步消失。这一问题在多代自循环训练中尤为显著,相关研究已在理论层面对其机制有所阐释。数据重复使用同样存在类似隐患:实验表明,对同一数据进行超过4个epoch的重复训练,性能提升不仅趋于停滞,有时还会出现轻微的性能退化。这些约束共同说明,Token/参数比的提升并非可以无限延伸,数据工程的质量边界是扩展定律优化中不可绕过的现实天花板。
对从业者的启示
对于正在规划模型训练的团队,这场讨论给出了几点可操作的方向:
其一,明确优化目标。如果模型将被高频部署,应向更小参数、更高Token覆盖的方向倾斜;如果是研究性探索或低频使用场景,则可更接近经典的计算最优配比。
其二,将推理成本前置到训练决策中。单纯以训练损失衡量"最优"已经不足以指导生产级模型的设计。
其三,关注数据质量而非仅看数量。更高的Token/参数比对数据质量提出了更严苛的要求,低质量数据的边际贡献可能为负。
结语
这篇讨论虽然篇幅不长,但触及了当前大模型训练的一个关键命题:扩展定律不是一成不变的公式,而是需要结合训练预算、推理场景和数据条件动态校准的工程决策。Token-per-Parameter Coverage作为连接训练效率与部署经济性的桥梁,正成为模型设计中越来越重要的考量维度。随着行业从"更大就是更好"转向"更聪明的配比",如何选对这一比例,将直接影响模型的竞争力与可持续性。
相关推荐

Rysh Forge 实测:一份 OpenAPI 规范自动生成 Claude 可调用的 Agent 工具
Rysh Forge 用一条命令把 OpenAPI 规范自动转换成 Claude 可调用的 Agent 工具,同时生成 MCP server、Python SDK 和文档,并对写操作强制人工确认,实现全链路可观测。本文解析其工作流与价值。

OpenAI Agents SDK 实战:如何实现 Human-in-the-Loop 人工审批
基于 OpenAI Agents SDK 实现 Human-in-the-Loop 人工审批机制的完整教程:从 needs_approval 暂停工具调用、捕获 interruptions 中断,到 approve/reject 决策与 RunState 状态序列化恢复,让 AI Agent 在执行高风险操作前先征得人类同意。

MaRN开源:用低维参数映射训练神经网络的PyTorch库
开源PyTorch库MaRN通过低维参数映射训练神经网络,MNIST CNN参数压缩57.7倍仍保持91.8%准确率。本文解析其基准测试、功能构成与适用场景。