[控场AI]
模型

DAPO

由字节跳动Seed团队与清华大学AIR联合推出的开源强化学习系统,聚焦大语言模型的对齐与推理能力训练,整合数据处理、奖励设计、分布式训练与评估等环节

时间轴 (近 90 天)

9月21日

DAPO 是由字节跳动 Seed 团队与清华大学 AIR(智能产业研究院)联合推出的开源强化学习系统,聚焦大语言模型的对齐与推理能力训练

待验证50%
9月21日

基于可验证奖励的强化学习是 DeepSeek-R1、DAPO 等近期工作的共同出发点

待验证50%
9月21日

DAPO 项目在 Hacker News 上被分享后引起了关注

已过期50%

全部知识事实 (2)

来源文章