ConceptResidual Stream / residual stream
残差流
Transformer架构中贯穿全网络的主干信息流,各层注意力头和前馈网络以加法形式将输出叠加其上,是激活修补等可解释性方法的主要操作对象
Timeline (last 90 days)
Oct 7
在有效的组件机制内部,引导效果进一步集中在残差流的约50%维度上,这部分维度保留了85%–98%的组件机制基线效果
Unverified50%
Oct 7
残差流是Transformer架构的核心信息通道,每一层的注意力头和MLP模块以读取-处理-写回的方式与残差流交互
Unverified50%
Sep 16
向残差流注入向量是机械可解释性领域常用的因果干预手段,直接作用于模型中间表征而非词汇层面
Unverified50%
Sep 16
在语言模型驱动的兵棋推演中,模型的语言输出同时决定了一个行为体试图做什么以及什么成为了被模拟的现实
Unverified50%
Sep 12
该框架把残差流(residual stream)视为模型各层之间的通信总线,注意力头和MLP从中读取信息并写回
Unverified50%
Sep 7
Arditi风格编辑源自2024年Andy Arditi等人的研究,核心发现是大语言模型的拒绝行为可以被定位到残差流中的单一方向向量
Unverified50%
All Facts (6)
Unverified
在有效的组件机制内部,引导效果进一步集中在残差流的约50%维度上,这部分维度保留了85%–98%的组件机制基线效果
50%Unverified残差流是Transformer架构的核心信息通道,每一层的注意力头和MLP模块以读取-处理-写回的方式与残差流交互
50%Unverified向残差流注入向量是机械可解释性领域常用的因果干预手段,直接作用于模型中间表征而非词汇层面
50%Unverified在语言模型驱动的兵棋推演中,模型的语言输出同时决定了一个行为体试图做什么以及什么成为了被模拟的现实
50%Unverified该框架把残差流(residual stream)视为模型各层之间的通信总线,注意力头和MLP从中读取信息并写回
50%UnverifiedArditi风格编辑源自2024年Andy Arditi等人的研究,核心发现是大语言模型的拒绝行为可以被定位到残差流中的单一方向向量
50%