概念Multi-turn Jailbreak
多轮越狱
一种AI安全攻击手法,通过多轮对话逐步引导模型偏离安全边界,每条单独消息不触发护栏,但整体对话实现越狱效果
时间轴 (近 90 天)
9月25日
通过缓慢建立信任的多轮对话逐步引导,模型最终会输出在第一条消息中被拒绝的答案,而护栏始终未触发
待验证50%
9月25日
学术界将此类攻击归类为多轮越狱,相关研究还包括渐进式提示注入和上下文操纵攻击
待验证50%
一种AI安全攻击手法,通过多轮对话逐步引导模型偏离安全边界,每条单独消息不触发护栏,但整体对话实现越狱效果
通过缓慢建立信任的多轮对话逐步引导,模型最终会输出在第一条消息中被拒绝的答案,而护栏始终未触发
学术界将此类攻击归类为多轮越狱,相关研究还包括渐进式提示注入和上下文操纵攻击