Unverified50% confidenceFactExact time
RL对pass@1的提升而不影响pass@k,本质上是在压缩模型的输出分布使其更集中在正确答案附近,即分布锐化
1
Sources
50%
Confidence
Long-term
Relevance
8/13/2026
First Seen
Sources
Related Claims
UnverifiedRLHF本质上是在模型输出分布上施加统计偏好,而非植入真正的价值理解,导致表面对齐在面对对抗性输入时易崩塌68% similarVerified从贝叶斯视角理解,L1正则化对应参数的拉普拉斯先验,L2正则化对应高斯先验62% similarUnverified权重往往近似对称分布适合对称量化,而激活值经过ReLU等非线性函数后分布偏移更适合非对称量化61% similarUnverifiedRLHF过程中形成的安全约束以分布式方式编码在数十亿参数中,而非硬编码规则,因此同一越狱手法在措辞略微调整后往往仍能奏效61% similarUnverifiedvLLM的推测解码(Speculative Decoding)通过拒绝采样机制保证输出分布与直接使用大模型生成完全一致,加速比通常在1.5-3倍之间61% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/742558API
curl https://kongchang.com/api/v1/knowledge/claims/742558MCP
get_claim(id=742558)