Unverified70% confidenceFactExact time
越狱攻击指通过精心构造的提示词绕过模型的安全对齐机制,使其输出有害内容
2
Sources
70%
Confidence
Long-term
Relevance
7/5/2026
First Seen
Sources
OpenAI支持Appia基金会:AI通用标准化的破局之路
rss6/23/2026
Related Claims
Unverified模型逃逸攻击通过添加大量感叹号或无意义特殊字符欺骗模型绕过安全限制77% similarUnverified通用越狱指单一提示词或操作序列能系统性绕过模型所有安全约束,而针对性越狱只能解锁某一类具体有害行为77% similarUnverified过度授权(如在只需生成文档时同时开放命令执行权限)会因提示词注入攻击或模型幻觉引入破坏性操作的安全风险77% similarUnverified基于阈值的防御面临贴边隐蔽投毒攻击的威胁,攻击者可让每个样本恰好停在容忍阈值边缘通过累积效应侵蚀概念71% similarUnverified过度公开检测技术细节可能为恶意方提供规避蓝图71% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/112159API
curl https://kongchang.com/api/v1/knowledge/claims/112159MCP
get_claim(id=112159)