模型
DAPO
由字节跳动Seed团队与清华大学AIR联合推出的开源强化学习系统,聚焦大语言模型的对齐与推理能力训练,整合数据处理、奖励设计、分布式训练与评估等环节
时间轴 (近 90 天)
9月21日
DAPO 是由字节跳动 Seed 团队与清华大学 AIR(智能产业研究院)联合推出的开源强化学习系统,聚焦大语言模型的对齐与推理能力训练
待验证50%
9月21日
基于可验证奖励的强化学习是 DeepSeek-R1、DAPO 等近期工作的共同出发点
待验证50%
9月21日
DAPO 项目在 Hacker News 上被分享后引起了关注
已过期50%