[
控场AI
]
知识动态
实体
播客
深度
开发者
关于
Get CLI
EN
论文
GRP Obliteration / Unaligning LLMs with a Single Unlabeled Prompt
GRP-Obliteration
一种大模型安全对齐移除技术,声称仅需单个未标注提示词即可解除开源LLM的安全对齐,属于白盒攻击范畴,结合强化学习优化范式(GRP)与激活方向消融思路
来源文章
GRP-Obliteration:单个提示词即可解除大模型安全对齐
9月15日