蒸馏DeepSeek到GPT-OSS:为什么审查机制不会随之转移

一个反直觉的发现:蒸馏能迁移能力却丢失审查
知识蒸馏(Knowledge Distillation)是当前AI模型压缩与能力迁移的核心技术之一。它的基本思路是:让一个较小的"学生模型"去学习一个更大或更强的"教师模型"的输出行为,从而以更低的成本获得接近的性能。
知识蒸馏最早由Geoffrey Hinton等人在2015年正式提出,其核心思想是利用教师模型输出的软标签(soft labels)——即概率分布而非硬标签——来指导学生模型的训练。软标签包含了类别之间的相对关系信息(即"暗知识"),例如教师模型可能认为某个回答有70%的概率正确、20%的概率部分正确,这种分布信息比简单的对错判断更有助于学生模型学习。在大语言模型领域,蒸馏通常通过让学生模型模仿教师模型在大量提示上的输出文本来实现,这种方式有时被称为"黑盒蒸馏",因为不需要访问教师模型的内部权重。
然而,一个近期在 Hacker News 上引发讨论的项目提出了一个反直觉的观察:当你将 DeepSeek 蒸馏到 GPT-OSS 时,模型的审查机制(censorship)并不会随之转移。 换句话说,学生模型学到了教师模型的能力,却没有继承教师模型内置的内容审查行为。
DeepSeek是由中国深度求索公司开发的大语言模型系列,以其高性价比和开源策略在全球引发关注。其最新版本DeepSeek-V3和DeepSeek-R1在多项基准测试上接近甚至超越GPT-4级别的表现,同时采用了混合专家(MoE)架构来降低推理成本。GPT-OSS则是基于开源框架构建的模型变体,旨在通过蒸馏等技术手段获取前沿模型的能力。这一蒸馏实验的背景是:随着中国模型在能力上快速追赶,其内置的合规审查机制(针对特定政治话题的拒答行为)是否会随蒸馏传播,成为了一个实际的技术与治理问题。
这个发现看似只是一个技术细节,但它触及了当下大模型治理与开源生态中一个非常关键的问题:模型的"能力"和模型的"价值对齐/审查约束",在多大程度上是可以被分离的?
知识蒸馏究竟迁移了什么
底层能力 vs 行为约束的本质区别
要理解这个现象,首先需要区分模型中两类不同的"知识":
- 底层能力:语言理解、推理、知识记忆、代码生成等,这些是模型在海量预训练中习得的通用能力。
- 行为约束:包括安全对齐、内容审查、拒答策略等,这些通常是在后训练(如 RLHF、指令微调)阶段被强化注入的。
RLHF(Reinforcement Learning from Human Feedback,基于人类反馈的强化学习)是当前主流的对齐技术路线。其流程通常包括三个阶段:首先进行监督微调(SFT),让模型学习遵循指令的基本格式;然后训练一个奖励模型(Reward Model),该模型根据人类标注者的偏好对模型输出进行评分;最后使用PPO(Proximal Policy Optimization)等强化学习算法,优化模型使其输出获得更高的奖励分数。审查行为正是在这个过程中被强化的——当模型遇到敏感话题时给出拒绝回答会获得高奖励,从而形成条件反射式的拒答模式。这种机制本质上是在模型已有能力之上叠加的一层行为策略。
DeepSeek 作为一款在国内合规环境下训练的模型,其对某些政治敏感话题的审查行为,很大程度上来自后训练阶段的对齐数据和拒答模式。而蒸馏过程如果主要针对的是模型在常规任务上的输出分布,那么这些高度依赖特定触发条件的审查行为,就可能"漏掉"没有被有效传递。
审查机制为什么没有跟着蒸馏走
审查行为往往表现为在特定输入下触发的"拒答"或"回避"模式。这类行为在训练数据中占比极低,且高度集中于特定话题。如果蒸馏所使用的提示数据集并不包含这些敏感触发场景,学生模型自然就学不到对应的拒答策略。
蒸馏过程中使用的提示数据集(prompt dataset)的设计至关重要,它决定了学生模型能从教师模型那里"看到"哪些行为。典型的蒸馏数据集会包含大量常规任务——数学推理、代码生成、文本摘要、多轮对话等——以确保能力的全面迁移。然而,触发审查行为的敏感提示在整体数据分布中占比极低(通常远低于1%),且研究者在构建蒸馏数据集时往往会主动回避此类争议性内容。这导致学生模型在训练过程中几乎没有机会观察到教师模型的拒答行为,自然也就无法学习到这一模式。这类似于一个学生从未见过考试中的某类题型,自然不会掌握对应的解题策略。
更进一步,GPT-OSS 作为学生模型本身可能带有自己的对齐基线。当它吸收 DeepSeek 的能力输出时,其原有的行为框架反而占据主导,导致教师模型特有的审查逻辑难以覆盖。
对开源模型治理和AI安全的启示
审查机制并非模型权重中不可分割的部分
这个项目最重要的启示在于:模型审查并非模型权重中不可分割的一部分,而是一层相对可分离的行为策略。 这意味着,通过蒸馏、微调等手段,研究者可以在保留模型能力的同时,改变或移除其原有的行为约束。
在AI安全研究中,存在所谓的"对齐税"(alignment tax)概念,指的是为了实现安全对齐而不得不牺牲的模型性能。研究表明,过度的安全训练会导致模型在正常任务上的表现下降——例如过于谨慎的模型可能拒绝回答完全无害的问题。蒸馏能迁移能力却丢失审查这一现象,从另一个角度证实了能力与安全约束之间存在张力:它们在模型内部的编码方式不同,能力更多体现为分布式的知识表示,而审查更接近于条件触发的浅层策略。Anthropic等公司提出的"宪法AI"(Constitutional AI)方法试图将价值观更深层地融入训练过程,正是为了解决这一分离问题。
这对开源社区而言是一把双刃剑:
- 一方面,它降低了"去审查化"的技术门槛,让研究者能够获得更中性、更少拒答的模型行为;
- 另一方面,它也说明现有的安全对齐机制可能比想象中脆弱,恶意行为者同样可以用类似手段绕过安全防护。
AI安全对齐需要更深层次的融入
如果审查行为可以在蒸馏中轻易丢失,那么依赖表层后训练的安全对齐策略就显得不够稳固。真正稳健的对齐,可能需要在预训练或更深层次上融入,而非仅靠后期的拒答样本堆叠。
这也是当前 AI 安全研究的一个前沿方向:如何让对齐成为模型能力的"内在属性",而不是一层容易被剥离的外壳。
这一发现对全球AI治理框架也提出了严峻挑战。目前各国的AI监管思路大多依赖于模型提供者在部署前进行安全对齐,即"前门管控"策略。但如果下游用户可以通过蒸馏等技术手段轻易移除这些约束,那么监管的有效性就会大打折扣。欧盟的《AI法案》、美国的AI行政命令以及中国的生成式AI管理办法,都面临类似的执行困境。开源模型一旦发布权重,其下游使用方式就难以完全控制。这推动了学界对"不可逆对齐"(irreversible alignment)和"模型水印"等技术方向的研究——目标是让安全属性即使在微调或蒸馏后仍能保持。
需要理性看待的实验边界
作为一个 Show HN 项目(20 点赞、9 条评论),它的讨论规模还相对有限,结论也需要更严谨的实验验证。几个值得注意的问题包括:
- 样本覆盖问题:审查行为的"消失"究竟是本质上无法迁移,还是仅仅因为蒸馏数据集没有覆盖触发场景?
- 测量标准:如何系统性地衡量一个模型的"审查程度",目前尚无统一基准。
- 可复现性:不同的蒸馏配置、温度参数、数据规模,可能会得出不同结论。
因此,这更应被视为一个引发思考的实验性观察,而非定论。
结语:能力与约束的可分离性值得深入研究
"蒸馏不转移审查"这一发现,本质上揭示了大模型中能力与约束的可分离性。它提醒我们,模型的行为边界远比权重文件更加脆弱和动态。对于开源生态、模型治理和 AI 安全研究而言,这既是一个值得深入探索的技术命题,也是一个必须认真对待的风险信号。
随着开源模型能力不断逼近闭源前沿,如何在保留开放性的同时构建真正稳健的对齐机制,将成为整个行业无法回避的核心挑战。
相关推荐

MLOps实战项目:衣物洗涤识别系统端到端构建全解析
通过一个衣物洗涤识别系统,详解MLOps端到端实战流程,涵盖自动化数据采集、模型再训练、Docker容器化、AWS云端部署以及Grafana+Prometheus监控,为MLOps初学者和求职者提供完整参考范本。

Row-Bot多智能体编排架构深度解析:父子Agent协作与并发控制
深入解析Row-Bot开源项目的多智能体编排架构,详解父子Agent分工模式、Git worktree并发安全机制、状态持久化与容错恢复设计,为AI Agent工程化落地提供可借鉴的协作范式。

Unsloth Desktop 发布:本地模型运行与训练一体化桌面应用
Unsloth Desktop 是一款开源跨平台桌面应用,集模型运行、微调训练、部署于一体,支持Mac/Windows/Linux,实现2倍训练加速与70%显存节省,零遥测保护隐私。