The System Prompt Illusion
发表于arXiv的学术论文,研究系统提示对大语言模型内部计算的影响,使用CKA方法分析17个模型的内部表征,揭示安全指令在模型计算层面几乎不产生实质影响的现象
时间轴 (近 90 天)
一项发表于arXiv的研究(arXiv:2609.38205)研究了系统提示对Transformer内部计算的影响
该研究覆盖了17个指令微调模型,横跨8个架构家族,参数规模从15亿到720亿不等
研究发现角色设定和格式化指令会深度重构模型的中间层表征,而安全指令几乎不改变计算
限制性安全指令与放开限制的指令所激活的计算路径几乎完全相同,平均CKA相关性高达0.997
即便在70B到72B的大模型中,安全指令的渗透率仍然低于10%,规模增大并未让安全提示更有效
线性探测基线显示模型在每一层都编码了提示的类别信息,但只在很小一部分层上真正重构计算过程
表征深度能够预测行为效应的大小,在全部17个模型中斯皮尔曼相关系数达到0.761(p<0.001)
该研究为基于系统提示的安全机制存在的越狱脆弱性提供了机制层面的解释
研究团队已开源相关代码(github.com/Usama1002/system-prompt-illusion-cka)
全部知识事实 (9)
一项发表于arXiv的研究(arXiv:2609.38205)研究了系统提示对Transformer内部计算的影响
50%待验证该研究覆盖了17个指令微调模型,横跨8个架构家族,参数规模从15亿到720亿不等
50%待验证研究发现角色设定和格式化指令会深度重构模型的中间层表征,而安全指令几乎不改变计算
50%待验证限制性安全指令与放开限制的指令所激活的计算路径几乎完全相同,平均CKA相关性高达0.997
50%待验证即便在70B到72B的大模型中,安全指令的渗透率仍然低于10%,规模增大并未让安全提示更有效
50%待验证线性探测基线显示模型在每一层都编码了提示的类别信息,但只在很小一部分层上真正重构计算过程
50%待验证表征深度能够预测行为效应的大小,在全部17个模型中斯皮尔曼相关系数达到0.761(p<0.001)
50%待验证该研究为基于系统提示的安全机制存在的越狱脆弱性提供了机制层面的解释
50%待验证研究团队已开源相关代码(github.com/Usama1002/system-prompt-illusion-cka)
50%