[控场AI]
· 5 分钟阅读· 2,714 字

在线策略蒸馏中的提示广度与响应刷新交互效应研究

在线策略蒸馏中的提示广度与响应刷新交互效应研究

研究发现OPD中提示广度与响应刷新存在深度交互,刷新频率决定了增加提示是否真正有益。

这篇论文系统研究了在线策略蒸馏(OPD)中提示广度与响应刷新频率的联合效应。在固定14,080条轨迹和110次优化步数的受控实验中,研究发现两者并非独立起作用:当响应频繁刷新时,仅8条提示即可接近使用14,080条提示的准确率(24.09% vs 24.51%),提示多样性的边际价值急剧下降;但响应冻结时,增加提示广度反而使准确率从21.16%降至19.05%。两者的交互效应达4.07个百分点,统计显著。论文还发现第二层反转:周期性刷新模型在短推理预算下占优,而冻结响应模型在32K token限制下准确率反超,但代价是消耗1.7至1.8倍的输出token。这些结论表明,OPD的提示效率是一个多因素耦合问题,需将响应刷新策略、提示广度与推理预算作为整体统一权衡。

研究背景:OPD 到底需要多少提示?

在线策略蒸馏(On-Policy Distillation, OPD)是当前大模型训练中的重要技术路线,它让学生模型自己生成训练响应,再由教师模型提供监督信号。一个长期悬而未决的实践问题是:OPD 究竟需要多少条不同的提示(prompt)才能达到理想效果?以及这个答案是否取决于生成训练响应的学生策略本身?

这篇来自 arXiv 的新论文(arXiv:2609.25048v1)首次将两个控制变量联合起来系统研究——提示广度(prompt breadth) 与 响应刷新(rollout refresh)。这两个因素以往往往被孤立看待,而研究者发现它们之间存在显著的交互效应,直接影响 OPD 的提示效率。

在线策略蒸馏与传统的离线蒸馏(Offline Distillation)有根本性的区别。离线蒸馏中,训练数据由教师模型一次性生成并固定,学生模型在静态数据集上学习;而在线策略蒸馏则要求学生模型在训练过程中持续用自身当前策略生成响应(rollout),再由教师模型对这些响应打分或提供概率监督。这一机制带来了"响应与当前策略对齐"的优势——学生学到的是如何改进自己当前会犯的错误,而非模仿一个与自己能力差距悬殊的固定分布。然而这也引入了一个工程复杂性:每次策略更新后,旧响应的分布就已经偏移,继续使用旧响应训练会引入"off-policy"偏差。响应刷新频率(rollout refresh rate)正是控制这一偏差程度的关键超参数,频繁刷新可以保持on-policy特性,但计算开销显著增加。

实验设计:固定预算下的 3×3 对照

研究团队构建了一个数学推理任务的 3×3 实验矩阵。为了保证公平比较,实验固定了 14,080 条轨迹 和 110 次优化器更新,只改变两个维度:提示库的大小(prompt bank),以及用于生成响应的策略快照数量(policy snapshots)。

这种设计的巧妙之处在于,它把计算预算和优化步数都锁死了,从而能够干净地分离出"提示多样性"与"响应新鲜度"各自的贡献,以及两者的相互作用。

OPD 研究论文示意

轨迹(trajectory)在这里指的是一条完整的"提示→响应"样本对,即一个 prompt 加上学生模型生成的完整输出序列。固定 14,080 条轨迹和 110 次优化器更新意味着:无论提示库大小如何变化,每次优化步骤所消耗的样本总量保持一致。当提示库只有 8 条时,同一条提示会被反复采样,学生模型对相同问题生成多条响应;当提示库扩展到 14,080 条时,则每条提示平均只被使用一次。这种设计将"多样性来源"从提示层面(prompt-level diversity)和响应层面(response-level diversity)严格解耦,使研究者可以独立测量两者对最终性能的贡献,而不受总计算量差异的干扰。

核心发现一:提示广度的效果取决于响应刷新

实验结果揭示了一个反直觉的现象——增加提示广度是好是坏,完全取决于响应是否刷新。

在使用十个策略快照的配置下,仅用 8 条提示 就能达到 24.09% 的平均准确率,几乎追平了使用 14,080 条不同提示时的 24.51%。换句话说,当响应足够"新鲜"时,提示数量的边际价值急剧下降。

但当响应被冻结在初始策略时,情况完全逆转:增加提示广度反而将准确率从 21.16% 拉低到 19.05%。而在每次更新都刷新响应(per-update refresh)的条件下,增加广度则把准确率从 23.61% 提升到 25.57%。

这一交互效应的量级达到 4.07 个百分点,其 95% 的问题配对置信区间为 [2.00, 6.28],统计上相当稳健。这意味着提示广度和响应刷新并非各自独立起作用,而是深度耦合。

核心发现二:推理预算下的第二次反转

论文还揭示了另一层更微妙的现象。在两种教师模型下的匹配对比中,研究者观察到了"第二次反转":

  • 周期性刷新模型(periodic models) 在短预算下表现更好——短输出预算内的准确率和答案完成度都更高;
  • 但当输出限制放宽到 32K 时,冻结响应模型(frozen-response models) 的平均准确率反超,代价是消耗了 1.7 至 1.8 倍 的响应 token。

这说明模型的优劣排序并不是绝对的,而是随着推理预算的变化而变化。在有限算力下占优的方案,未必在充足预算下仍然领先。

推理预算(inference budget)或输出 token 限制,是指模型在生成答案时允许输出的最大 token 数量。对于数学推理等需要多步骤思考的任务,输出长度直接决定了模型能展开多深的推理链。在有限 token 预算下,模型必须用更紧凑的方式给出答案;而在宽松预算(如 32K token)下,模型可以进行大量的中间推导甚至自我验证(self-verification)。不同训练策略产生的模型往往在"用短输出解决问题"和"充分利用长输出"这两种能力上各有侧重。冻结响应训练的模型可能学会了更冗长的推理模式,因为训练时见到的响应本身就缺乏多样性,模型倾向于通过延伸输出来提升答对概率;而频繁刷新响应的模型则在更紧凑的推理上更有优势。这一发现提示,单点 benchmark 评估可能系统性地偏向某类模型,需要在多个推理预算档位下进行综合评估。

实践启示:提示效率是个多因素问题

这项研究的价值在于打破了"提示越多越好"或"提示越少越省"的简单认知。它清晰地表明,OPD 中的提示效率同时取决于响应刷新策略和推理预算。

对于工程实践者而言,这带来几个直接的思考方向:

  • 如果训练管线能够频繁刷新学生响应,那么扩大提示库确实能带来收益;反之,在响应冻结的情况下盲目增加提示反而适得其反。
  • 评估模型时不能只看单一输出预算下的表现,需要在不同 token 预算下综合考量,否则可能得出片面的结论。
  • 在设计蒸馏方案时,响应刷新频率、提示广度、推理预算这三者需要作为一个整体来权衡,而非孤立调优。

这是一篇偏理论与实证的研究工作,其结论对于正在优化蒸馏训练流程的团队具有较强的参考意义,尤其是在算力受限、需要精打细算提示与轨迹预算的场景下。

分享:

相关推荐