待验证75% 置信事实时间未知
2024年以来,研究者发现了对抗性后缀攻击(Adversarial Suffix),即在正常提示后附加一串看似无意义的token序列就能让模型忽略安全对齐
1
来源数
75%
置信度
长期有效
时效性
2026/6/1
首次发现
来源
AI Guardrails Index:最全面的LLM安全护栏评估体系详解
twitterguardrails_ai
涉及实体
相关事实
待验证2024年研究揭示了多跳间接注入攻击,攻击者先污染模型记忆或工具调用状态,再通过后续交互完成数据外泄,使基于单次请求的检测系统失效73% 相似待验证2023年卡内基梅隆大学研究团队发现了基于梯度的自动化越狱方法(GCG攻击),通过在提示词后附加看似无意义的后缀字符串即可绕过几乎所有主流模型的安全防护71% 相似待验证2024年多项基准测试表明,即便采用组合防御,顶级模型在复杂间接注入场景下的成功拦截率仍在60-80%区间70% 相似已验证2024年多项学术研究表明当前主流LLM对精心设计的提示注入攻击的抵抗能力仍然有限68% 相似待验证对抗补丁能干扰检测系统的原因在于它能拉高背景类别预测概率,或制造大量虚假高置信度检测框(幽灵目标),淹没真实人体目标68% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/27801API
curl https://kongchang.com/api/v1/knowledge/claims/27801MCP
get_claim(id=27801)