Unverified50% confidenceFactExact time
红队测试中发现的对抗性样本被加入训练数据用于RLHF中的负面信号,形成攻防螺旋上升的循环
1
Sources
50%
Confidence
Long-term
Relevance
8/7/2026
First Seen
Sources
Related Claims
UnverifiedRLHF微调阶段相比预训练在数据量级上通常小2-3个数量级,使安全行为编码为低秩覆写而非底层重塑69% similarUnverified低精度引入的数值扰动会在RL的多轮迭代中通过策略梯度的乘积形式被放大,可能导致训练崩溃或模型性能退化68% similarUnverifiedRLHF和DPO两种对齐方法均面临分布外泛化难题,训练数据未充分覆盖的边界输入无法完全防范62% similarUnverified研究表明RLHF在模型残差流中留下的安全拒绝行为呈现低秩线性结构,主要分布在少数几个主方向上,因此易被正交投影移除61% similarUnverified研究人员通过n-gram重叠分析和成员推断攻击可判断特定数据是否出现在模型训练集中,但存在误报率偏高的局限60% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/700725API
curl https://kongchang.com/api/v1/knowledge/claims/700725MCP
get_claim(id=700725)