概念probe / 线性探针 / 隐藏状态探针
安全探针
一种LLM安全防御技术,通过读取模型内部隐藏层向量并训练轻量级线性分类器来检测恶意提示,不依赖模型输出而直接透视模型内部表征,用于在模型生成输出前拦截提示注入等攻击
时间轴 (近 90 天)
9月16日
安全探针是一种通过读取模型内部隐藏层向量来检测恶意提示的防御手段,不依赖模型输出
待验证50%
一种LLM安全防御技术,通过读取模型内部隐藏层向量并训练轻量级线性分类器来检测恶意提示,不依赖模型输出而直接透视模型内部表征,用于在模型生成输出前拦截提示注入等攻击
安全探针是一种通过读取模型内部隐藏层向量来检测恶意提示的防御手段,不依赖模型输出