Abliteration
一种大模型权重编辑技术,通过识别并正交投影消除模型残差流中与拒绝行为相关的线性方向向量,使模型失去安全拒答能力,无需重新训练即可完成,由Maxime Labonne等研究者于2024年提出
Timeline (last 90 days)
Abliteration(消融)方法由 Maxime Labonne 等研究者于2024年提出并推广
实验表明经过 abliteration 处理的模型在常规能力测评上几乎不退化,但拒绝有害请求的概率大幅下降
Abliteration 处理无需重新训练,仅做权重编辑即可完成
Abliteration 的核心原理是在模型残差流中寻找拒绝方向,并将该方向从权重矩阵中正交投影消除
Abliteration技术的原理是识别并抑制模型内部与拒绝行为相关的方向向量,从而让模型不再触发安全性拒答,而非重新训练模型
经过abliteration处理的模型在通用能力上几乎不受损失,却失去大部分安全约束
Abliteration 技术最早由 failspy 等社区研究者在2024年推广开来
模型的拒绝行为集中在残差流(residual stream)中的一个特定方向向量上,可通过 PCA 或差异均值方法提取
Dolphin 是数据层面的去审查,abliteration 是模型内部表征层面的去审查,两种方法可以叠加使用
Abliteration 技术最早由 failspy 等社区研究者在 2024 年推广开来,灵感部分源自 Representation Engineering 领域研究
1 more timeline events
All Facts (11)
Abliteration(消融)方法由 Maxime Labonne 等研究者于2024年提出并推广
50%Unverified实验表明经过 abliteration 处理的模型在常规能力测评上几乎不退化,但拒绝有害请求的概率大幅下降
50%UnverifiedAbliteration 处理无需重新训练,仅做权重编辑即可完成
50%UnverifiedAbliteration 的核心原理是在模型残差流中寻找拒绝方向,并将该方向从权重矩阵中正交投影消除
50%UnverifiedAbliteration技术的原理是识别并抑制模型内部与拒绝行为相关的方向向量,从而让模型不再触发安全性拒答,而非重新训练模型
50%Unverified经过abliteration处理的模型在通用能力上几乎不受损失,却失去大部分安全约束
50%UnverifiedAbliteration 技术最早由 failspy 等社区研究者在2024年推广开来
50%Unverified模型的拒绝行为集中在残差流(residual stream)中的一个特定方向向量上,可通过 PCA 或差异均值方法提取
50%UnverifiedDolphin 是数据层面的去审查,abliteration 是模型内部表征层面的去审查,两种方法可以叠加使用
50%UnverifiedAbliteration 技术最早由 failspy 等社区研究者在 2024 年推广开来,灵感部分源自 Representation Engineering 领域研究
50%UnverifiedAbliteration技术通过识别并抑制模型残差流中负责拒绝行为的方向向量,用正交投影从权重矩阵中移除该方向,无需重新训练即可消除拒绝行为
50%