激活引导
机械可解释性领域的因果干预技术,通过在模型前向传播过程中向残差流注入预提取的概念方向向量,直接操控模型内部状态以研究特定表征与行为之间的因果关系
Core Facts
Timeline (last 90 days)
线性引导依赖线性表征假设,当概念分布本身弯曲时,沿固定方向推移激活会偏离真实概念流形,导致控制失真或产生不自然的中间状态
激活引导(activation steering)的基本操作是找到代表某概念的激活方向向量,在推理时叠加到中间层激活上,从而在不改变权重的情况下干预输出
一项发表于arXiv的研究(arXiv:2609.38205)研究了系统提示对Transformer内部计算的影响
激活引导(activation steering)或表示工程(representation engineering)直接在模型的内部激活层上施加干预向量,在不修改模型权重的情况下改变生成方向
向残差流注入向量是机械可解释性领域常用的因果干预手段,直接作用于模型中间表征而非词汇层面
在语言模型驱动的兵棋推演中,模型的语言输出同时决定了一个行为体试图做什么以及什么成为了被模拟的现实
模型引导(steering)通过在推理过程中直接修改中间层的激活向量,在不修改权重的前提下影响模型输出行为
All Facts (7)
模型引导(steering)通过在推理过程中直接修改中间层的激活向量,在不修改权重的前提下影响模型输出行为
85%Unverified线性引导依赖线性表征假设,当概念分布本身弯曲时,沿固定方向推移激活会偏离真实概念流形,导致控制失真或产生不自然的中间状态
50%Unverified激活引导(activation steering)的基本操作是找到代表某概念的激活方向向量,在推理时叠加到中间层激活上,从而在不改变权重的情况下干预输出
50%Unverified一项发表于arXiv的研究(arXiv:2609.38205)研究了系统提示对Transformer内部计算的影响
50%Unverified激活引导(activation steering)或表示工程(representation engineering)直接在模型的内部激活层上施加干预向量,在不修改模型权重的情况下改变生成方向
50%Unverified向残差流注入向量是机械可解释性领域常用的因果干预手段,直接作用于模型中间表征而非词汇层面
50%Unverified在语言模型驱动的兵棋推演中,模型的语言输出同时决定了一个行为体试图做什么以及什么成为了被模拟的现实
50%