[KongchangAI]
Concept消融方法 / abliteration / 权重消融

Abliteration

一种大模型权重编辑技术,通过识别并正交投影消除模型残差流中与拒绝行为相关的线性方向向量,使模型失去安全拒答能力,无需重新训练即可完成,由Maxime Labonne等研究者于2024年提出

Timeline (last 90 days)

Sep 15

Abliteration(消融)方法由 Maxime Labonne 等研究者于2024年提出并推广

Unverified50%
Sep 15

实验表明经过 abliteration 处理的模型在常规能力测评上几乎不退化,但拒绝有害请求的概率大幅下降

Unverified50%
Sep 15

Abliteration 处理无需重新训练,仅做权重编辑即可完成

Unverified50%
Sep 15

Abliteration 的核心原理是在模型残差流中寻找拒绝方向,并将该方向从权重矩阵中正交投影消除

Unverified50%
Sep 5

Abliteration技术的原理是识别并抑制模型内部与拒绝行为相关的方向向量,从而让模型不再触发安全性拒答,而非重新训练模型

Unverified50%
Sep 5

经过abliteration处理的模型在通用能力上几乎不受损失,却失去大部分安全约束

Unverified50%
Sep 2

Abliteration 技术最早由 failspy 等社区研究者在2024年推广开来

Unverified50%
Sep 2

模型的拒绝行为集中在残差流(residual stream)中的一个特定方向向量上,可通过 PCA 或差异均值方法提取

Unverified50%
Sep 2

Dolphin 是数据层面的去审查,abliteration 是模型内部表征层面的去审查,两种方法可以叠加使用

Unverified50%
Sep 2

Abliteration 技术最早由 failspy 等社区研究者在 2024 年推广开来,灵感部分源自 Representation Engineering 领域研究

Unverified50%

1 more timeline events

All Facts (11)

Source Articles