[
控场AI
]
知识动态
实体
播客
深度
开发者
关于
Get CLI
EN
概念
Single-rollout Asynchronous Optimization / 单轮次异步优化
SAO
一种用于大语言模型后训练的强化学习算法,结合单轮次采样与异步优化机制,旨在提升长程训练稳定性与效率,在编程和数学推理基准上表现优于GRPO
来源文章
SAO异步优化算法详解:稳定千步训练如何超越GRPO
9月12日