待验证50% 置信事实精确时间
jailbreak攻击(如DAN提示、Base64编码指令、多语言切换攻击)本质上是试图将模型推入训练分布之外,使其进入对齐约束薄弱的行为空间
1
来源数
50%
置信度
长期有效
时效性
2026/8/21
首次发现
来源
相关事实
待验证通过精心设计的越狱提示词(Jailbreak Prompts),攻击者可绕过主流LLM的安全护栏使其生成有害内容75% 相似待验证后门攻击(Backdoor Attack)指攻击者在训练数据中植入触发器,使模型在正常输入下表现正常但遇到特定触发词时产生预设的恶意输出69% 相似待验证编码混淆攻击将违规信息用Base64等方式编码后输入,可绕过基于关键词的表层过滤机制66% 相似待验证系统提示词的公开可能使jailbreak(越狱攻击)变得更加容易,因为攻击者可以精确了解安全规则的具体措辞和逻辑结构65% 相似待验证ExploitGym是一种评估AI网络安全攻防能力的基准测试,要求模型将已知软件漏洞(CVE)转化为完整的端到端漏洞利用代码,且只有使用题目预期漏洞才能得满分62% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/784181API
curl https://kongchang.com/api/v1/knowledge/claims/784181MCP
get_claim(id=784181)