Unverified50% confidenceFactExact time
2023年多项学术研究证明GPT-4、Claude等主流大模型均对提示注入攻击存在不同程度的脆弱性
1
Sources
50%
Confidence
Long-term
Relevance
7/6/2026
First Seen
Sources
AI编程助手成攻击新目标:DNS隐蔽信道窃取开发者凭据
bilibili世事宜AI7/3/2026
Related Claims
Unverified来自ETH Zurich、Google DeepMind等机构的研究证明GPT-4、Claude等顶级模型在对抗性提示面前存在显著脆弱性,成功率有时超过50%81% similarUnverified研究表明GPT-4、Claude等顶级模型在精心构造的对抗性攻击下成功率有时超过50%81% similarUnverified该论文通过在提示词末尾附加自动生成的对抗性字符串,成功让GPT-4、Claude等多个顶级模型产生有害输出,且该攻击可跨模型迁移79% similarUnverified不同大模型(GPT-4、Claude、Llama等)对Prompt的响应特性有所不同,实践中需要针对具体模型进行调优75% similarUnverified研究者已在GPT-4、Claude等主流模型上发现基准污染的统计异常75% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/113189API
curl https://kongchang.com/api/v1/knowledge/claims/113189MCP
get_claim(id=113189)