[控场AI]
论文GRP Obliteration / Unaligning LLMs with a Single Unlabeled Prompt

GRP-Obliteration

一种大模型安全对齐移除技术,声称仅需单个未标注提示词即可解除开源LLM的安全对齐,属于白盒攻击范畴,结合强化学习优化范式(GRP)与激活方向消融思路

来源文章