[控场AI]
概念Multi-turn Jailbreak

多轮越狱

一种AI安全攻击手法,通过多轮对话逐步引导模型偏离安全边界,每条单独消息不触发护栏,但整体对话实现越狱效果

时间轴 (近 90 天)

9月25日

通过缓慢建立信任的多轮对话逐步引导,模型最终会输出在第一条消息中被拒绝的答案,而护栏始终未触发

待验证50%
9月25日

学术界将此类攻击归类为多轮越狱,相关研究还包括渐进式提示注入和上下文操纵攻击

待验证50%

全部知识事实 (2)

来源文章