Qwen3去审查模型批量发布:MTP保留与GGUF全格式支持

一次性发布多款去审查模型
近日,Hugging Face 社区开发者 llmfan46 一口气发布了多款基于 Qwen3 系列的去审查(Uncensored)微调模型,涵盖从中等规模到超大参数量的多个版本,并且全部提供 GGUF 格式支持,方便本地部署使用。这一批发布包括 Qwen3.8-27B、Qwen3.5-122B-A10B、Qwen3-Coder-Next 以及带视觉能力的 Laguna-S2.1,覆盖了文本推理、代码生成和多模态等多个应用场景。
所谓"去审查"模型,是指通过微调手段移除或弱化大语言模型在训练阶段被注入的安全对齐(Safety Alignment)限制的模型版本。主流大模型在发布前通常会经过 RLHF(基于人类反馈的强化学习)或 DPO(直接偏好优化)等对齐训练,使模型拒绝回答涉及暴力、非法活动、敏感话题等内容的请求。去审查微调的核心挑战在于如何精准地移除这些拒答行为,同时不损害模型的通用推理能力和知识储备。
对于本地大模型爱好者和开发者而言,这类去审查模型的价值在于提供了更少限制的实验环境。开发者在发布说明中特别强调,这批模型保留了原生 MTP(Multi-Token Prediction,多 Token 预测)能力,这在去审查微调过程中是一个技术难点——许多微调过程会破坏原有的架构特性。MTP 是一种推理加速技术,传统自回归语言模型每次前向传播只预测下一个 token,而 MTP 架构允许模型在单次前向传播中同时预测多个后续 token。这种设计通过额外的预测头实现并行输出,在推理阶段可以配合投机解码(Speculative Decoding)策略显著提升生成速度。在微调过程中,如果训练流程未正确处理这些额外的预测头参数,MTP 模块的权重就会被破坏或重置,导致加速能力丧失,因此保留 MTP 需要对训练配置进行精细调整。

核心模型解析:Qwen3.8-27B 与 Qwen3.5-122B
Qwen3.8-27B Ultra Uncensored Heretic
作为本次发布的旗舰之一,Qwen3.8-27B Ultra Uncensored Heretic 版本采用了 "Heretic" 去审查方法,并保留了原生 MTP 能力。Heretic 是开源社区中一种相对新颖的去审查方法论,其核心思路区别于传统的大规模指令数据集重训。传统去审查方法通常需要使用大量无拒答行为的对话数据进行全量或 LoRA 微调,这一过程往往伴随着模型通用能力的退化(即所谓的灾难性遗忘)。Heretic 方法据称采用了更精细的干预策略,可能涉及对模型中与拒答行为相关的特定神经元或注意力模式进行靶向修改,从而在最小化对模型整体权重空间扰动的前提下解除安全限制。
根据开发者提供的数据,该模型在 100 次测试中仅出现 3 次拒答(3/100 refusals),同时 KLD(KL 散度)仅为 0.0244。
KL 散度(Kullback-Leibler Divergence)是信息论中衡量两个概率分布差异程度的经典指标。在大模型微调评估语境下,KLD 用于比较微调后模型与原始模型在相同输入下的输出概率分布差异。KLD 为零意味着两个分布完全相同,数值越大表示偏离越严重。对于去审查微调而言,理想状态是仅改变模型对敏感请求的拒答行为,而不影响其在通用任务上的表现——这正是低 KLD 所反映的。0.0244 的 KLD 意味着微调几乎没有改变模型的整体行为分布,仅在目标行为(去除拒答)上做了精准调整,这在微调技术中被称为"外科手术式"修改,是高质量微调的重要标志。从本次发布的极低 KLD 数据来看,Heretic 方法在保持模型原有分布方面确实表现出色,体现了去审查技术从粗放式重训向精准式调整演进的趋势。
该模型提供了极为丰富的格式选择,包括 Safetensors 原始权重、GGUF、NVFP4、NVFP4 的 GGUF 变体,以及 GPTQ-Int4 量化版本,几乎覆盖了从高精度推理到低显存部署的全部需求。
Qwen3.5-122B-A10B:大参数 MoE 架构去审查版
Qwen3.5-122B-A10B 是本批发布中参数量最大的模型。从命名可以看出,这是一个总参数量约 122B、激活参数约 10B 的 MoE(混合专家)架构模型。
MoE(Mixture of Experts)是一种通过条件计算实现高效扩展的神经网络架构。在 MoE Transformer 中,传统的前馈网络(FFN)层被替换为多个并行的"专家"网络,每个专家是一个独立的 FFN 模块。一个可训练的路由器(Router/Gate)网络负责为每个输入 token 动态选择最相关的少数几个专家进行计算(通常为 Top-K 选择),其余专家不参与当前 token 的处理。以 Qwen3.5-122B-A10B 为例,其总参数量达 1220 亿,但每次推理仅激活约 100 亿参数,这使得它在拥有远超同等激活参数密集模型的知识容量的同时,推理速度和显存需求与一个 10B 级别的模型相当。Google 的 Switch Transformer 和 Mixtral 是 MoE 架构在大语言模型领域的早期代表作,如今这一架构已成为训练超大规模模型的主流选择。这种设计让模型在拥有庞大知识容量的同时,推理时的实际计算量仍然可控。
该模型同样保留了 MTP 能力,去审查测试数据为 100 次中出现 8 次拒答(8/100),KLD 为 0.0856。相比 27B 版本,其 KLD 略高,拒答率也稍高,这在更大规模模型的去审查处理中属于合理范围——参数量越大,安全对齐行为分布在权重空间中的分散程度越高,精准移除的难度也相应增加。目前该版本仅提供 GGUF 格式。
代码与多模态去审查模型
Qwen3-Coder-Next 去审查版
Qwen3-Coder-Next 是应 Hugging Face 社区用户请求而制作的代码专用去审查模型。Qwen 系列的 Coder 模型本身在开源代码生成领域一直有不错的口碑,这个去审查版本为需要更自由代码生成环境的开发者提供了新选择。在代码生成场景中,安全对齐限制有时会过度拒绝合法的安全研究、渗透测试脚本或系统级编程请求,去审查版本在这些场景下可以减少不必要的阻断。该模型目前提供 GGUF 格式。
Laguna-S2.1 视觉模型
最后是带视觉能力的 Laguna-S2.1 模型。开发者坦诚地指出,其视觉部分"远非完美"(far from perfect),并给出了实用建议:如果不需要视觉功能,用户可以选择不下载 mmproj 文件,模型将作为纯文本模型正常运行。这里的 mmproj 文件是多模态投影器(Multimodal Projector)的权重文件,负责将视觉编码器提取的图像特征映射到语言模型的嵌入空间中,是连接视觉理解与文本生成的桥梁组件。
这种诚实的态度值得肯定,也提醒用户在多模态能力上要有合理预期。视觉理解的微调难度本身较高,需要同时处理视觉编码器、投影层和语言模型之间的复杂交互,社区开发者能提供一个可选的视觉模块已属不易。
本地部署方式与量化版本选择建议
所有模型均提供 GGUF 格式,这意味着可以直接在 Ollama、llama.cpp 等主流本地推理框架中运行。GGUF(GPT-Generated Unified Format)是由 llama.cpp 项目创建的模型存储格式,专为本地 CPU/GPU 混合推理设计,将模型权重、分词器配置和元数据统一打包在单个文件中,并原生支持多种量化精度。这一格式的普及极大降低了本地部署大模型的技术门槛,已成为开源社区分发量化模型的事实标准。
开发者给出了 Ollama 的示例命令,例如下载 Q4_K_M 量化版本:
ollama run hf.co/llmfan46/Qwen3.8-27B-Ultra-Uncensored-Heretic-Native-MTP-Preserved-GGUF:Q4_K_M
对于普通用户而言,Q4_K_M 是显存占用与质量之间较好的平衡点。Q4_K_M 采用 llama.cpp 的 k-quants 分组量化策略,会根据不同层的重要性自适应使用不同的量化精度,在 4-bit 级别的压缩率下尽量保持模型质量。如果显存有限,可以考虑 NVFP4 或 GPTQ-Int4 等更激进的量化版本——NVFP4 是 NVIDIA 针对其新一代 GPU 架构推出的 4-bit 浮点量化格式,利用硬件级别的 FP4 支持实现更高推理吞吐量;GPTQ-Int4 则是基于二阶信息的训练后量化方法,通过最小化量化误差来保持精度,被 vLLM、TGI 等服务框架广泛支持。如果追求最高质量且硬件充足,则可以选择 Safetensors 原始权重进行 FP16/BF16 精度推理。
开源社区生态的持续繁荣
这批发布再次体现了开源大模型社区的活跃与创造力。从 Heretic 去审查方法到 MTP 能力保留,再到全格式量化支持,个人开发者已经能够独立完成过去需要团队才能实现的复杂工作。这种能力的提升得益于整个开源工具链的成熟——从 Hugging Face Transformers 库提供的标准化模型接口,到 PEFT/LoRA 等参数高效微调框架降低的训练门槛,再到 llama.cpp 生态提供的完善量化和部署工具链,每一环的进步都在为个体创作者赋能。
开发者表示这批模型的制作"投入了巨大的工作量",并希望用户能通过 Ko-fi 给予支持。这也反映出开源社区面临的现实:优质模型的产出需要大量投入(包括 GPU 算力成本、数据准备和测试验证的时间精力),而可持续的贡献往往依赖社区的正向激励。
对于想要探索无限制大模型能力的开发者和研究者来说,这批模型提供了从 27B 到 122B、从纯文本到多模态、从代码到通用推理的完整选择。不过需要提醒的是,使用去审查模型时应遵守相关法律法规,并对生成内容负责。
核心要点
相关推荐

Maiao:在GitHub上实现Gerrit式代码审查工作流
Maiao是一款开源工具,将Gerrit风格的单提交单审查、堆叠式变更等代码审查工作流带入GitHub、GitLab、Gitea等主流平台,无需部署额外服务器即可享受精细化代码审查体验。

微调4B小模型:浏览器任务准确率从22%飙升至63%
通过在3000条浏览器操作轨迹上微调Qwen3.5-4B模型,准确率从22%提升至63%,甚至超越DeepSeek V4 Pro等大模型。详解实验设计、基准测试结果及对开发者的实践启示。

手写微型CNN比推理引擎快3倍:树莓派端侧优化实战解析
一位开发者在树莓派上手写微型CNN,通过SIMD向量化和算子融合三步优化,实现比ONNX Runtime、ncnn等主流推理引擎快3倍的性能。深入解析为何专用代码能在边缘计算场景击败通用框架。