待验证85% 置信事实时间未知
越狱攻击经历了从简单角色扮演(如DAN提示)到Base64编码绕过、多轮对话渐进式诱导(Crescendo Attack)、对抗性后缀攻击等多个演进阶段
1
来源数
85%
置信度
长期有效
时效性
2026/6/1
首次发现
来源
AI Guardrails Index:最全面的LLM安全护栏评估体系详解
twitterguardrails_ai
涉及实体
相关事实
引用此条事实
Stable URI
https://kongchang.com/claim/27806API
curl https://kongchang.com/api/v1/knowledge/claims/27806MCP
get_claim(id=27806)