[控场AI]
· 5 分钟阅读· 2,930 字

RISED:多环境智能体训练的评分标准选择与自蒸馏方法

RISED:多环境智能体训练的评分标准选择与自蒸馏方法

RISED提出用评分标准与自蒸馏解决多环境智能体联合训练中的数据选择与奖励信号失效问题。

RISED(Rubrics for Agentic Multi-Environment Selection and Self-Distillation)针对通用智能体多环境联合训练中的两大核心痛点:现有课程学习方法只能在环境级别粗粒度分配训练资源,缺乏跨环境 prompt-group 层面的精细选择;以及 GRPO 类组相对优化算法在"全失败"或"全成功"rollout 组上梯度为零、训练信号白白浪费的问题。RISED 通过引入结构化评分标准(Rubrics)跨环境比较样本价值,实现更精细的数据筛选;同时借助自蒸馏机制,将模型自身生成的高质量轨迹转化为监督信号,弥补组相对奖励失效时的学习空白。目前公开信息仅涵盖方法动机与框架,具体算法细节与实验验证有待完整论文披露。

通用智能体训练的新难题

让单个大语言模型(LLM)智能体在多样化的交互环境中联合训练,被视为通往通用型智能体的重要路径。这个方向近年来吸引了越来越多的研究关注——如果一个模型能够同时在编程、网页操作、工具调用等不同任务场景中学习,它就有望发展出跨领域的泛化能力,而不是沦为只能处理单一任务的专用系统。

然而,实现这一目标并不简单。当多个环境被塞进同一个训练流程时,如何合理分配训练资源、如何筛选有价值的训练样本,成为决定最终性能的关键。RISED 这项工作正是针对这一痛点提出的解决方案,其全称为 Rubrics for Agentic Multi-Environment Selection and Self-Distillation(面向智能体多环境选择与自蒸馏的评分标准方法)。

RISED: Rubrics for Agentic Multi-Environment Selection and Self-Distillation

现有方法的两大局限

当前主流的课程学习(curriculum)和数据选择策略,大多存在两个明显的短板。

环境级别的粗粒度分配

现有方法往往在环境级别分配训练量,或者优先依赖局部的、基于奖励(reward)的信号来挑选数据。这种做法的问题在于,它没有显式地考虑不同环境之间当前 rollout(模型在环境中实际交互产生的轨迹)的相互关系,无法在 prompt-group(提示组)层面做出更精细的选择。换句话说,它把每个环境当作孤立的训练单元,忽略了跨环境样本之间可能存在的互补或冗余关系。

失效的组相对奖励信号

第二个问题更为隐蔽。由于不同环境的学习速度存在差异,在同一个训练批次(batch)中,可能同时出现"全部失败"和"全部成功"的 rollout 组。对于这两类极端情况,组相对奖励信号(group-relative reward signal)会失效——当一组样本全对或全错时,组内样本之间没有相对优劣的梯度信息可供学习,这部分数据实际上被白白浪费了。这是采用组相对优化方法(如 GRPO 类算法)时常见的训练效率损失。

GRPO(Group Relative Policy Optimization)是近年来强化学习微调 LLM 的主流算法之一,由 DeepSeek广告 团队提出并在 DeepSeek-R1 等模型训练中广泛使用。其核心思想是:对同一个 prompt 采样多条输出(即一个"组"),通过组内各条输出的奖励相对高低来估计优势函数(advantage),从而省去了传统 PPO 算法中需要单独训练的 critic 网络。这种设计大幅降低了训练开销,但也带来了结构性缺陷——当一组输出的奖励完全相同时(全对或全错),组内无法计算出有意义的相对优势,梯度为零,这些样本对模型参数更新毫无贡献。在多环境联合训练场景中,由于不同任务的难度差异悬殊,某些环境的模型能力可能在某阶段已经"饱和"(全对)或尚未起步(全错),导致批次内这类"哑"样本的比例显著上升,进一步加剧了训练效率的损失。

RISED 的核心思路

从命名可以拆解出 RISED 的两条技术主线。

Rubrics 驱动的样本选择

"Rubrics"(评分标准)意味着 RISED 不再单纯依赖原始奖励值,而是引入更结构化的评估标准来指导多环境下的样本选择。通过评分标准,模型可以在跨环境的 prompt-group 之间建立更合理的比较基础,从而在选择训练数据时考虑到不同环境 rollout 之间的关系,而非孤立地看待每个环境。

课程学习(Curriculum Learning)指按照一定顺序或难度梯度向模型呈现训练数据,而非随机采样,其思想源自人类由易到难的学习规律。在 LLM 强化学习训练中,课程策略常体现为动态调整不同任务或环境的采样权重——例如优先训练当前模型尚未掌握的中等难度任务,跳过过难或过易的样本。现有多环境课程方法通常以"环境"为调度粒度,根据各环境的平均奖励或成功率动态提升或降低其采样比例。RISED 的 Rubrics 机制将这一粒度细化到 prompt-group 层面,意味着即便在同一个环境内部,不同提示所对应的样本组也可以被差异化地筛选,使数据选择更贴近模型在具体子任务上的实际学习状态。

自蒸馏弥补信号空白

针对"全失败"与"全成功"组缺乏组相对奖励信号的问题,RISED 引入了**自蒸馏(Self-Distillation)**机制。自蒸馏允许模型从自身产生的高质量轨迹中提取监督信号,为那些原本无法通过组相对奖励学习的样本提供额外的学习来源。这样一来,批次中那些因学习速度不均而"失语"的数据,也能被重新利用起来,提升整体训练的数据利用率。

知识蒸馏(Knowledge Distillation)的传统形式是将"教师模型"的输出分布作为软标签,监督"学生模型"的训练,以此将大模型的能力迁移至小模型。自蒸馏(Self-Distillation)则省去了独立教师模型,转而让模型向自身在历史检查点或当前推理中产生的高质量输出学习。在强化学习语境下,自蒸馏通常表现为:将模型自己生成的、奖励较高的完整轨迹转化为监督学习信号(如行为克隆目标),直接对这些轨迹进行极大似然训练,从而绕过组相对奖励信号缺失的限制。这一机制与 STaR、ReST 等迭代自改进方法在思路上一脉相承,核心都是"用模型自己的成功案例引导自身进步",区别在于 RISED 将其专门用于修复多环境训练中信号失效的边角情形。

为什么这件事值得关注

通用型智能体是当前 AI 领域极具野心的目标之一。相比训练一堆各自为政的专用模型,一个能跨环境泛化的智能体在部署成本、维护复杂度和能力迁移上都更具优势。但多环境联合训练的工程与算法挑战,恰恰是阻碍这一愿景落地的核心障碍。

RISED 的价值在于,它把注意力从"分配多少训练量给哪个环境"这种粗粒度调度,转向了"如何在跨环境的样本层面做精细筛选"以及"如何救回被浪费的训练信号"这两个更底层的效率问题。这类改进虽然不如新模型架构那样引人注目,但对于强化学习驱动的智能体训练而言,数据选择与信号利用效率往往直接决定了训练能否收敛到更强的策略。

小结

RISED 聚焦于多环境智能体训练中的两个实际痛点:缺乏跨环境 prompt-group 层面的精细选择,以及批次内极端 rollout 组导致的奖励信号失效。它通过评分标准(Rubrics)引导的样本选择和自蒸馏(Self-Distillation)两条路径,试图提升多环境联合训练的数据利用率与泛化效果。

需要说明的是,当前公开素材仅披露了方法的动机与整体框架,关于具体的算法实现细节、实验环境配置以及量化性能提升,仍有待完整论文的进一步披露。对于关注强化学习与通用智能体方向的研究者而言,这是一个值得持续跟踪的工作。

分享:

相关推荐