Unsloth新版本:MTP让Qwen与GLM推理提速2倍

开源微调框架 Unsloth 近日发布了 v0.1.805-beta 版本,带来了一项引人注目的性能升级:通过 MTP(Multi-Token Prediction,多令牌预测)技术,让 Qwen3.8-Flash-Next 和 GLM-5.3-Flash 两款模型的推理速度提升最高达 2 倍。同时,本次更新还包含了 170 多项训练、聊天、硬件与性能相关的改进,是一次内容相当丰富的迭代。
Unsloth 由 Daniel Han 和 Michael Han 兄弟创立,是目前最受欢迎的开源大模型高效微调框架之一。它通过手写 Triton 内核、自定义反向传播和内存优化等底层技术,能在不损失精度的前提下将 LoRA/QLoRA 微调速度提升 2-5 倍,同时将显存占用降低约 70%。除了 Python 库,团队还推出了 Unsloth Desktop 桌面应用,让非技术用户也能通过图形界面完成模型下载、微调、量化和本地部署的全流程操作。

MTP多令牌预测:推理提速的核心引擎
本次版本最大的亮点在于 MTP 的默认启用。MTP(多令牌预测)是一种通过让模型在单次前向传播中预测多个后续 token 的技术,能够显著减少推理时的计算轮次,从而带来实实在在的速度提升。
要理解 MTP 的价值,需要先了解传统大语言模型的生成机制。传统模型采用自回归(Autoregressive)解码方式——每次前向传播只预测下一个 token,然后将该 token 拼接到输入序列末尾,再进行下一次前向传播。这意味着生成一段 100 个 token 的文本就需要 100 次前向传播,计算开销与生成长度成线性关系。MTP 的核心思路最早由 Meta 在 2024 年的论文《Better & Faster Large Language Models via Multi-token Prediction》中系统提出,其原理是在模型顶部添加多个预测头(prediction heads),每个头负责预测序列中不同位置的未来 token。在推理阶段,模型可以配合投机解码(Speculative Decoding)策略:先用 MTP 头并行草拟多个候选 token,再由主模型一次性验证,从而将多步生成压缩为更少的前向传播次数。这种方法在训练时还能提供更丰富的梯度信号,帮助模型学习更长程的依赖关系。DeepSeek-V3 和 Qwen3 等新一代模型已在预训练阶段原生集成了 MTP 机制。
Unsloth 官方表示,Qwen3.8-Flash-Next 与 GLM-5.3-Flash 在开启 MTP 后,生成速度最高可达此前的 2 倍。说个细节,MTP 现已成为默认配置,用户无需额外设置即可享受加速红利;当然,如果对特定场景有精度或稳定性方面的考量,也可以选择手动关闭。
除此之外,这两款模型还获得了更细致的优化:GLM 现在能够在更长的多轮对话中稳定调用工具,而 Qwen 会自动应用官方推荐的思考模式(thinking)与非思考模式(non-thinking)配置,降低了用户的调参门槛。官方也同步提供了 Qwen 与 GLM 的使用指南和可用的 GGUF 量化文件。
为什么 MTP 值得关注
对于本地部署大模型的用户而言,推理速度往往是体验的核心瓶颈。传统的自回归解码逐个生成 token,效率受限;而 MTP 通过一次预测多个 token,本质上是在压缩生成步数。在保持输出质量的前提下将速度翻倍,意味着同样的硬件可以承载更高的吞吐量,或者说更低配置的设备也能获得流畅的交互体验。这对于消费级显卡用户和 Mac 用户尤其有意义。
Apple Silicon 上的 MLX 全面升级
本次更新对 Mac 用户格外友好。基于 MLX 框架,Unsloth 现在支持在 Apple Silicon 上对两款大型 MoE(混合专家)模型进行文本或图像的微调。
MLX 是 Apple 机器学习研究团队于 2023 年底开源的深度学习框架,专为 Apple Silicon(M1/M2/M3/M4 系列芯片)的统一内存架构(Unified Memory Architecture)设计。与传统 GPU 计算需要在 CPU 内存和 GPU 显存之间来回拷贝数据不同,Apple Silicon 的 CPU、GPU 和 Neural Engine 共享同一块物理内存,MLX 充分利用了这一特性实现零拷贝数据传输,大幅降低了内存开销和延迟。MLX 的 API 设计高度参考了 NumPy 和 PyTorch,同时采用惰性求值(lazy evaluation)和动态图机制,使得在 MacBook 或 Mac Studio 上本地运行数十亿参数的大模型成为现实。
MoE(Mixture of Experts,混合专家)是一种条件计算架构,其核心理念是将模型的前馈网络层拆分为多个并行的「专家」子网络,每次推理时由一个门控(Gating)网络根据输入 token 的特征动态选择少量专家参与计算。例如,一个拥有 128 个专家的 MoE 模型,每次可能只激活其中 8 个,使得总参数量庞大但实际计算开销远小于同等规模的稠密模型。不过,MoE 模型的显存占用仍与总参数量相关——所有专家的参数都需要加载到内存中,这也是为什么 Apple Silicon 的大容量统一内存和 MLX 框架对运行 MoE 模型特别有价值。
更令人惊喜的是速度上的飞跃:长对话场景下的 Qwen 在 Mac 上运行明显更快,后续轮次的响应速度最高可提升 30 倍。此外,MLX 模型现在能够使用完整的上下文长度,并支持更长的批量生成;在多次生成之间以及模型切换时,MLX 也能更干净地释放 GPU 显存,避免了内存堆积的问题。
Unsloth 还打通了服务化能力——用户可以通过 Unsloth 提供的 OpenAI 兼容 API 来对外提供 MLX 模型服务,同时支持将 GLM-5.3 的 MLX 微调结果导出为 GGUF 格式,进一步增强了工作流的连贯性。GGUF(GPT-Generated Unified Format)是由 llama.cpp 项目开发者设计的模型文件格式,它将模型权重、分词器、元数据等信息封装在单个文件中,并原生支持 Q4_K_M、Q5_K_S、Q8_0 等多种量化精度,是目前 llama.cpp、Ollama、LM Studio 等主流本地推理工具最广泛支持的格式。将 MLX 微调结果导出为 GGUF,意味着用户可以在 Mac 上完成微调后,轻松将模型部署到任何支持 GGUF 的推理引擎上。
音频模型支持大扩展
除了文本模型,Unsloth 在音频领域也迈出了重要一步,新增了对 MiniMax-Music3、Higgs、MOSS 等多款音频模型的支持。
在使用体验上,音频生成过程现在会显示实时进度更新,让用户对长时间任务的状态一目了然;生成的音频片段也可以被归档和管理。稳定性方面,官方修复了自定义 TTS(Text-to-Speech,文本转语音)播放、Whisper(OpenAI 开发的开源语音识别模型)配对检查等多个问题,并强化了音频测试体系。这一系列改进标志着 Unsloth 正从单纯的文本微调工具,向多模态本地 AI 平台演进。
聊天与Agent工具调用的可靠性提升
在 Agent 与工具调用日益重要的当下,本次更新在聊天与工具链路上做了大量打磨:
- 并行工具调用:可以同时发起多个工具调用而不会混淆各自的参数,这对复杂 Agent 工作流至关重要。
- 图像场景保留工具:在附带图像聊天时,工具依然可用。
- 持久 MCP 连接:每个聊天会保持独立的 MCP 连接,加快工具调用速度。MCP(Model Context Protocol,模型上下文协议)是由 Anthropic 于 2024 年底推出的开放标准,旨在为大语言模型提供与外部数据源和工具交互的统一接口。MCP 采用客户端-服务器架构,通过标准化的 JSON-RPC 通信解决了此前每个工具都需要单独适配的「M×N 集成」难题。持久化的 MCP 连接可以避免每次调用时重新建立连接的开销,同时保持会话级别的状态隔离,防止不同聊天会话之间的上下文污染。
- 代码编辑能力:本地模型现在可以使用 Codex 的
apply_patch工具直接编辑代码。 - 自动压缩(Auto Compaction):支持在包含图像等媒体的长对话中继续交流。当对话上下文接近模型的最大上下文窗口时,自动压缩会智能地总结和压缩早期对话内容,在保留关键信息的同时释放上下文空间,使对话能够持续进行而不中断。
- Deep Research 审批:用户可以在研究开始前审核并批准研究计划。
这些细节共同构成了一个更成熟、更值得信赖的本地 Agent 环境。
训练与硬件兼容性改进
在训练和硬件层面,Unsloth 同样带来了扎实的改进。多 GPU 训练支持自动设备分配,能够将更大的模型拆分到多张显卡上运行,官方在多个 PR 中重点修复了显存规划、拆分模型训练以及 index_select 相关的崩溃问题。
对 AMD/ROCm 用户而言,本次更新强化了 GPU 检测、安装流程和兼容性。ROCm(Radeon Open Compute platform)是 AMD 推出的开源 GPU 计算平台,定位为 NVIDIA CUDA 的替代方案,提供了 HIP 编程接口,允许开发者以接近 CUDA 的语法编写 GPU 加速代码。近年来,随着 AMD Instinct MI250/MI300 系列在数据中心的部署以及 RX 7900 系列消费级显卡对 ROCm 支持的完善,PyTorch 等主流框架已经提供了官方的 ROCm 构建版本。然而,ROCm 生态相比 CUDA 仍面临驱动兼容性碎片化、不同 GPU 架构(如 gfx10、gfx11)支持程度不一等挑战。
本次更新中,AMD 安装会在 Windows 与 Linux 上自动选择最佳构建版本,并在更多 GPU 上启用 BF16(Brain Floating Point 16,一种由 Google Brain 提出的 16 位浮点格式,相比 FP16 具有更大的指数范围,在深度学习训练中可以有效避免数值溢出),同时修复了 gfx10 ROCm GPU 的 BF16 检测和 Debian 分离栈上的 ROCm 检测问题。
在导出方面,用户现在可以自定义 GGUF 分片大小和保存位置,灵活性大幅提升。对于动辄数十 GB 的大型模型文件,分片功能允许将单个 GGUF 文件拆分为多个较小的文件块,便于在存储受限的环境中管理和传输。
API 与桌面端体验优化
作为一款免费且开源的桌面应用,Unsloth Desktop 支持 Windows、macOS 和 Linux 三大平台。本次桌面端更新亮点包括:
- 新增 OpenAI 兼容的 Videos API,可通过统一接口生成视频。
- 更新在后台下载,重启时自动安装,减少打断。
- 支持自定义端口用于局域网访问。
- 模型下载进度显示更清晰,并能在 Xet 传输卡住时自动切换到 HTTP。Xet 是 Hugging Face 推出的新一代大文件存储和传输协议,旨在替代 Git LFS,通过内容感知的分块和去重技术大幅提升大型模型文件的上传下载效率。
- 长期缺失的 Ctrl+F 搜索功能终于可用。
结语
从 MTP 带来的 2 倍推理加速,到 MLX 在 Apple Silicon 上高达 30 倍的对话提速,再到音频多模态、Agent 工具链和 AMD 硬件兼容性的全面强化,Unsloth v0.1.805-beta 是一次覆盖面极广的更新。它不仅在性能上给出了硬核数字,更在稳定性和易用性上做了大量细致打磨。对于希望在本地高效运行和微调开源大模型的开发者而言,这个版本非常值得升级尝试。
核心要点
相关推荐

Dude系统:双检测多智能体如何揪出论文与代码的不一致
Dude是首个面向论文-代码差异检测的双检测多智能体系统,通过粒度对齐协商和两阶段显著性过滤机制,解决了多智能体系统中的过度解读与误报问题,召回率和精确率最高提升22.8%,F1分数提升18.7%。

全双工语音助手隐式指令遵循评测:DSB-IFEval基准解析
深入解析DSB-IFEval基准测试,揭示全双工语音助手在隐式指令遵循、人设推理和冲突消解方面的能力短板。覆盖六大语音系统实测对比,剖析架构差异带来的行为与内容权衡。

提示工程实现AI教学助手个性化:六维画像框架详解
深入解析基于提示工程的AI教学助手个性化框架,通过六维学习者画像与布鲁姆认知分类法,无需重训练模型即可实现96种个性化教学风格,为教育AI落地提供务实工程路径。