待验证50% 置信事实精确时间
研究者发现只需微调模型的少量参数就能移除安全对齐(去对齐攻击),且某些越狱提示可在不同模型之间迁移
1
来源数
50%
置信度
长期有效
时效性
2026/8/13
首次发现
来源
相关事实
待验证大模型对指令的敏感度呈非线性分布——主干指令的微小改动可能引发全局行为漂移,而在末尾追加具体的边界条件则相对安全78% 相似待验证底层模型更换后,即便微小的输出分布变化也可能导致此前校准的安全护栏过度拦截或防护失效,需要重新标注和调试77% 相似待验证通过'不要按常规套路'这样的约束性提示词,本质上是在调整模型的采样分布,降低高频方案的输出权重,迫使模型探索低概率但可能更具创新性的输出区域75% 相似待验证小模型比大模型更易发生嵌入坍缩,原因包括参数容量有限、优化捷径倾向和各向异性问题被放大74% 相似待验证参数量较小的本地模型可能出现指令漂移,更可靠的方案是结合引用溯源和答案验证层构建多重防护74% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/742386API
curl https://kongchang.com/api/v1/knowledge/claims/742386MCP
get_claim(id=742386)