[控场AI]
论文arXiv:2609.38205 / 系统提示幻觉

The System Prompt Illusion

发表于arXiv的学术论文,研究系统提示对大语言模型内部计算的影响,使用CKA方法分析17个模型的内部表征,揭示安全指令在模型计算层面几乎不产生实质影响的现象

时间轴 (近 90 天)

10月1日

一项发表于arXiv的研究(arXiv:2609.38205)研究了系统提示对Transformer内部计算的影响

待验证50%
10月1日

该研究覆盖了17个指令微调模型,横跨8个架构家族,参数规模从15亿到720亿不等

待验证50%
10月1日

研究发现角色设定和格式化指令会深度重构模型的中间层表征,而安全指令几乎不改变计算

待验证50%
10月1日

限制性安全指令与放开限制的指令所激活的计算路径几乎完全相同,平均CKA相关性高达0.997

待验证50%
10月1日

即便在70B到72B的大模型中,安全指令的渗透率仍然低于10%,规模增大并未让安全提示更有效

待验证50%
10月1日

线性探测基线显示模型在每一层都编码了提示的类别信息,但只在很小一部分层上真正重构计算过程

待验证50%
10月1日

表征深度能够预测行为效应的大小,在全部17个模型中斯皮尔曼相关系数达到0.761(p<0.001)

待验证50%
10月1日

该研究为基于系统提示的安全机制存在的越狱脆弱性提供了机制层面的解释

待验证50%
10月1日

研究团队已开源相关代码(github.com/Usama1002/system-prompt-illusion-cka)

待验证50%

全部知识事实 (9)

来源文章