产品Transformer Reinforcement Learning
TRL
Hugging Face开源的大语言模型后训练框架,支持SFT、RLHF、DPO、蒸馏等多种训练方法,广泛用于LLM微调与对齐研究
时间轴 (近 90 天)
9月14日
社区涌现出RLHF的简化替代方案,包括 DPO(直接偏好优化)和 RLAIF(用AI反馈替代人类反馈),并在 TRL、OpenRLHF 等开源框架中实现
待验证50%
Hugging Face开源的大语言模型后训练框架,支持SFT、RLHF、DPO、蒸馏等多种训练方法,广泛用于LLM微调与对齐研究
社区涌现出RLHF的简化替代方案,包括 DPO(直接偏好优化)和 RLAIF(用AI反馈替代人类反馈),并在 TRL、OpenRLHF 等开源框架中实现