[KongchangAI]
ConceptJailbreak / 越狱攻击 / AI越狱

越狱

针对AI大语言模型安全护栏的绕过技术,通过角色扮演诱导、多轮对话渗透、语义混淆或对抗性后缀等手段使模型产生违反安全策略的输出,是AI安全领域的核心研究议题。

Timeline (last 90 days)

Jul 5

越狱手法可分为提示注入、对抗性前缀攻击、多步骤语境构建以及自动化越狱

Unverified60%

All Facts (1)

Source Articles