[控场AI]
待验证70% 置信事实精确时间

Hugging Face 的 TRL 库提供了 SFT(监督微调)、DPO(直接偏好优化)、GRPO 等训练范式的标准化实现

2
来源数
70%
置信度
长期有效
时效性
2026/7/8
首次发现

来源

相关事实

引用此条事实

Stable URI
https://kongchang.com/claim/218376
API
curl https://kongchang.com/api/v1/knowledge/claims/218376
MCP
get_claim(id=218376)