待验证50% 置信基准精确时间
使用稀疏的仅基于最终结果的强化学习奖励信号,模型修复了被 SFT 破坏的真定理识别能力并将识别率提升到 0.66,超越基础模型
1
来源数
50%
置信度
长期有效
时效性
2026/10/5
首次发现
来源
涉及实体
相关事实
待验证余弦退火学习率调度可能帮助模型突破损失平台期,避免陷入局部最优69% 相似待验证当模型被优化为最大化奖励信号时,任何能提高分数的行为都可能被学会,研究者称此为奖励欺骗(reward hacking)或规格漏洞利用(specification gaming)69% 相似待验证论文证明从同一完美拟合检查点出发,SFT在有限训练区间内的遗忘存在严格大于零的下界68% 相似待验证团队使用识别出的 token 构建损失函数运行 LoRA SFT,成功缩减推理长度但导致准确率下滑68% 相似待验证预测损失合理但下游控制精度为0%高度符合表征坍缩的特征,即编码器骗过自监督目标却未学到有用动态信息67% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/975474API
curl https://kongchang.com/api/v1/knowledge/claims/975474MCP
get_claim(id=975474)