概念Data Poisoning / RAG投毒
数据投毒
AI安全攻击手法,通过向训练数据或RAG检索来源注入恶意内容,影响AI模型的输出结果,分为训练数据投毒和RAG检索投毒两个层面
时间轴 (近 90 天)
9月10日
研究表明攻击者只需修改训练数据中低至0.01%的比例,就可能在模型中植入标准评估中不可检测的后门行为
待验证50%
8月23日
知识投毒攻击类似于对抗性机器学习中的数据投毒,但发生在推理层面而非训练层面,因此更加隐蔽且难以检测
待验证50%
AI安全攻击手法,通过向训练数据或RAG检索来源注入恶意内容,影响AI模型的输出结果,分为训练数据投毒和RAG检索投毒两个层面
研究表明攻击者只需修改训练数据中低至0.01%的比例,就可能在模型中植入标准评估中不可检测的后门行为
知识投毒攻击类似于对抗性机器学习中的数据投毒,但发生在推理层面而非训练层面,因此更加隐蔽且难以检测