Unverified50% confidenceFactExact time
jailbreak攻击(如DAN提示、Base64编码指令、多语言切换攻击)本质上是试图将模型推入训练分布之外,使其进入对齐约束薄弱的行为空间
1
Sources
50%
Confidence
Long-term
Relevance
8/21/2026
First Seen
Sources
Related Claims
Unverified通过精心设计的越狱提示词(Jailbreak Prompts),攻击者可绕过主流LLM的安全护栏使其生成有害内容75% similarUnverified后门攻击(Backdoor Attack)指攻击者在训练数据中植入触发器,使模型在正常输入下表现正常但遇到特定触发词时产生预设的恶意输出69% similarUnverified编码混淆攻击将违规信息用Base64等方式编码后输入,可绕过基于关键词的表层过滤机制66% similarUnverified系统提示词的公开可能使jailbreak(越狱攻击)变得更加容易,因为攻击者可以精确了解安全规则的具体措辞和逻辑结构65% similarUnverifiedExploitGym是一种评估AI网络安全攻防能力的基准测试,要求模型将已知软件漏洞(CVE)转化为完整的端到端漏洞利用代码,且只有使用题目预期漏洞才能得满分62% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/784181API
curl https://kongchang.com/api/v1/knowledge/claims/784181MCP
get_claim(id=784181)