Unverified50% confidenceBenchmarkExact time
使用稀疏的仅基于最终结果的强化学习奖励信号,模型修复了被 SFT 破坏的真定理识别能力并将识别率提升到 0.66,超越基础模型
1
Sources
50%
Confidence
Long-term
Relevance
10/5/2026
First Seen
Sources
Related Entities
Related Claims
Unverified余弦退火学习率调度可能帮助模型突破损失平台期,避免陷入局部最优69% similarUnverified当模型被优化为最大化奖励信号时,任何能提高分数的行为都可能被学会,研究者称此为奖励欺骗(reward hacking)或规格漏洞利用(specification gaming)69% similarUnverified论文证明从同一完美拟合检查点出发,SFT在有限训练区间内的遗忘存在严格大于零的下界68% similarUnverified团队使用识别出的 token 构建损失函数运行 LoRA SFT,成功缩减推理长度但导致准确率下滑68% similarUnverified预测损失合理但下游控制精度为0%高度符合表征坍缩的特征,即编码器骗过自监督目标却未学到有用动态信息67% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/975474API
curl https://kongchang.com/api/v1/knowledge/claims/975474MCP
get_claim(id=975474)