待验证50% 置信事实精确时间
RLHF微调阶段相比预训练在数据量级上通常小2-3个数量级,使安全行为编码为低秩覆写而非底层重塑
1
来源数
50%
置信度
长期有效
时效性
2026/7/13
首次发现
来源
雅可比透镜实战:用J-Space手动改造大语言模型行为
redditr/LocalLLaMA2026/7/11
相关事实
待验证低精度引入的数值扰动会在RL的多轮迭代中通过策略梯度的乘积形式被放大,可能导致训练崩溃或模型性能退化74% 相似待验证红队测试中发现的对抗性样本被加入训练数据用于RLHF中的负面信号,形成攻防螺旋上升的循环69% 相似待验证LLM在面对开放性问题时倾向于输出训练数据中频率最高的安全表达,即听起来正确但信息密度极低的通用结论69% 相似待验证RLHF和DPO两种对齐方法均面临分布外泛化难题,训练数据未充分覆盖的边界输入无法完全防范69% 相似待验证Two-stage检测器先通过RPN生成候选框再逐一分类,精度高但速度慢;One-stage检测器将候选框生成与分类合并为一步,牺牲少量精度换取数十倍速度提升69% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/501500API
curl https://kongchang.com/api/v1/knowledge/claims/501500MCP
get_claim(id=501500)