Unverified50% confidenceFactExact time
RLCD的奖励归一化机制将带噪声的得分函数项放大了3.6到15倍,是其性能差距的主要原因
1
Sources
50%
Confidence
Long-term
Relevance
10/5/2026
First Seen
Sources
Related Entities
Related Claims
UnverifiedRLDS在HotpotQA和DeepResearch上的提升处于噪声范围内,与这两个任务可回收信息不多的诊断预测一致71% similarUnverified研究表明在干净测试集上得分相近的两个模型面对带噪声真实输入时性能差距可能扩大数倍69% similarUnverified使用无偏的留一法(leave-one-out)估计器能够恢复RLCD大部分性能差距67% similarUnverified批次归一化层在小批次场景下统计量估计噪声很大,与Dice损失的区域级计算特性叠加会放大预测概率分布的波动67% similarUnverified14倍的提升由多因子叠加而来:批处理贡献3-4倍、内存优化贡献1.5-2倍、会话复用与线程调优再叠加若干67% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/975541API
curl https://kongchang.com/api/v1/knowledge/claims/975541MCP
get_claim(id=975541)