[控场AI]
产品Transformer Reinforcement Learning

TRL

Hugging Face开源的大语言模型后训练框架,支持SFT、RLHF、DPO、蒸馏等多种训练方法,广泛用于LLM微调与对齐研究

时间轴 (近 90 天)

9月14日

社区涌现出RLHF的简化替代方案,包括 DPO(直接偏好优化)和 RLAIF(用AI反馈替代人类反馈),并在 TRL、OpenRLHF 等开源框架中实现

待验证50%

全部知识事实 (1)

来源文章