Unverified50% confidenceFactExact time
后门攻击在训练数据中植入触发器,使模型在正常输入下表现正常,遇到特定触发词时产生预设的恶意输出
1
Sources
50%
Confidence
Long-term
Relevance
7/13/2026
First Seen
Sources
AI智能体安全攻防实战:7大攻击手法与五层防御体系
bilibiliAI课堂7/9/2026
Related Claims
Verified提示注入是一种针对大语言模型的攻击手法,攻击者通过在模型输入数据中嵌入恶意指令劫持模型的正常行为76% similarUnverified某些越狱攻击的有效性来自于诱导模型进入特定吸引子状态,使输出在该框架内自我强化73% similarUnverified若训练数据完全由正样本构成,模型会倾向于对任何输入都强行调用工具,产生幻觉式调用72% similarUnverified提示注入利用的是模型无法可靠区分「数据」与「指令」的天然缺陷,这一缺陷根植于LLM的训练机制本身70% similarUnverified通过激活修补(Activation Patching)等因果分析方法可以发现,真正影响模型最终输出的内部路径与书面推理并不吻合70% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/501426API
curl https://kongchang.com/api/v1/knowledge/claims/501426MCP
get_claim(id=501426)