[控场AI]
概念uncensored fine-tuning / Heretic系列

去审查微调

社区开发者通过使用不含拒绝示例的数据集或DPO训练方法,对已对齐模型进行二次微调以移除或弱化拒绝机制的技术方向

时间轴 (近 90 天)

9月21日

社区中流行的'去审查微调'通常只移除安全限制层,对训练数据造成的隐性偏差毫无作用

待验证50%

全部知识事实 (1)

来源文章