Unverified50% confidenceFactExact time
研究者发现只需微调模型的少量参数就能移除安全对齐(去对齐攻击),且某些越狱提示可在不同模型之间迁移
1
Sources
50%
Confidence
Long-term
Relevance
8/13/2026
First Seen
Sources
Related Claims
Unverified大模型对指令的敏感度呈非线性分布——主干指令的微小改动可能引发全局行为漂移,而在末尾追加具体的边界条件则相对安全78% similarUnverified底层模型更换后,即便微小的输出分布变化也可能导致此前校准的安全护栏过度拦截或防护失效,需要重新标注和调试77% similarUnverified通过'不要按常规套路'这样的约束性提示词,本质上是在调整模型的采样分布,降低高频方案的输出权重,迫使模型探索低概率但可能更具创新性的输出区域75% similarUnverified小模型比大模型更易发生嵌入坍缩,原因包括参数容量有限、优化捷径倾向和各向异性问题被放大74% similarUnverified参数量较小的本地模型可能出现指令漂移,更可靠的方案是结合引用溯源和答案验证层构建多重防护74% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/742386API
curl https://kongchang.com/api/v1/knowledge/claims/742386MCP
get_claim(id=742386)