待验证50% 置信事实精确时间
RL对pass@1的提升而不影响pass@k,本质上是在压缩模型的输出分布使其更集中在正确答案附近,即分布锐化
1
来源数
50%
置信度
长期有效
时效性
2026/8/13
首次发现
来源
相关事实
待验证RLHF本质上是在模型输出分布上施加统计偏好,而非植入真正的价值理解,导致表面对齐在面对对抗性输入时易崩塌68% 相似已验证从贝叶斯视角理解,L1正则化对应参数的拉普拉斯先验,L2正则化对应高斯先验62% 相似待验证权重往往近似对称分布适合对称量化,而激活值经过ReLU等非线性函数后分布偏移更适合非对称量化61% 相似待验证RLHF过程中形成的安全约束以分布式方式编码在数十亿参数中,而非硬编码规则,因此同一越狱手法在措辞略微调整后往往仍能奏效61% 相似待验证vLLM的推测解码(Speculative Decoding)通过拒绝采样机制保证输出分布与直接使用大模型生成完全一致,加速比通常在1.5-3倍之间61% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/742558API
curl https://kongchang.com/api/v1/knowledge/claims/742558MCP
get_claim(id=742558)