待验证50% 置信事实精确时间
PPO等主流RL算法依赖rollout阶段采集的log概率来计算重要性采样比率,若推理与训练引擎的log-prob存在系统性偏差会导致策略梯度方差增大甚至训练发散
1
来源数
50%
置信度
长期有效
时效性
2026/7/12
首次发现
来源
DeepSeek-V4 Flash RL训练成功迁移AMD MI355X GPU全解析
twitterlmsysorg2026/7/10
相关事实
待验证KL散度约束衡量新策略与参考策略间的概率分布差异,通过惩罚过大偏移防止模型遗忘预训练阶段的语言能力68% 相似待验证超大规模分布式训练中硬件故障概率随节点数量指数级上升,GPU 静默错误可能在数百步后才被发现,需从最近检查点重新训练67% 相似待验证研究人员通过n-gram重叠分析和成员推断攻击可判断特定数据是否出现在模型训练集中,但存在误报率偏高的局限67% 相似待验证在收敛型任务上,模型达到一定规模后存在明显的性能饱和现象,参数量或训练数据的继续增加对准确率的边际贡献快速衰减67% 相似待验证模型微调的真正难点在于高质量训练数据的构建与清洗、防止灾难性遗忘,以及量化后的推理部署67% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/492346API
curl https://kongchang.com/api/v1/knowledge/claims/492346MCP
get_claim(id=492346)