Unsloth新版本:MTP让Qwen3与GLM推理提速2倍

Unsloth v0.1.806-beta 通过MTP技术为Qwen3与GLM实现最高2倍推理加速,同时完成170余项涵盖MLX、音频多模态、Agent工具链和AMD兼容性的全面升级。
开源微调框架 Unsloth 发布 v0.1.806-beta,核心亮点是 MTP(多令牌预测)技术的引入,使 Qwen3.8-Flash-Next 和 GLM-5.3-Flash 的推理速度最高提升至原来的 2 倍。Apple Silicon 用户同样受益:MLX 后端优化使长对话后续轮次响应速度最高提升 30 倍。此外,更新大幅扩展了音频多模态支持(新增 MiniMax-Music3、Higgs、MOSS 等模型),强化了 Agent 工具调用可靠性(包括并行工具调用、MCP 连接持久化、Auto Compaction 等),并全面改善了 AMD/ROCm 的硬件兼容性。整体 170 余项改动标志着 Unsloth 正从单一微调工具演进为覆盖训练、推理、多模态与 Agent 的本地大模型综合平台。
开源微调框架 Unsloth 近日发布了 v0.1.806-beta 版本,带来了一项引人注目的性能升级:通过 MTP(Multi-Token Prediction,多令牌预测)技术,Qwen3.8-Flash-Next 和 GLM-5.3-Flash 两款模型的推理速度最高可提升至原来的 2 倍。这次更新还包含了超过 170 项训练、聊天、硬件与性能方面的改进,是 Unsloth 生态迈向成熟的重要一步。

MTP多令牌预测:让大模型一次预测多个Token
传统的自回归语言模型在生成文本时是逐个 token 预测的,每次前向传播只输出一个 token,这在推理阶段成为速度瓶颈。MTP(多令牌预测)技术的核心思路是让模型在一次前向计算中同时预测多个后续 token,从而显著减少推理所需的迭代次数。
在本次 Unsloth 更新中,MTP 已对 Qwen3.8-Flash-Next 和 GLM-5.3-Flash 默认启用。官方数据显示,两款模型在开启 MTP 后生成速度最高可达此前的 2 倍。值得一提的是,MTP 虽为默认开启,但用户仍可根据需求手动关闭,这为不同硬件条件和精度要求的场景保留了灵活性。
对于本地部署大模型的开发者而言,推理速度直接关系到实际可用性。MTP 的引入意味着在同等硬件条件下,可以获得更流畅的对话体验和更高的吞吐量,尤其在多轮长对话场景中优势更为明显。
Qwen3与GLM的双重优化细节
除了速度提升,Unsloth 还针对这两款模型做了细节优化。Qwen 会自动应用推荐的思考(thinking)与非思考(non-thinking)模式设置,无需用户手动调参;而 GLM 则支持在更长的多轮对话中稳定调用工具(tools),并修复了此前 GLM-5.3 在工具运行后聊天中断的问题。
官方同时提供了 Qwen 与 GLM 的配置指南以及可下载的 GGUF 量化模型文件,降低了普通用户的上手门槛。
MLX推理优化:Apple Silicon用户的本地大模型福音
对于使用 Mac 的开发者,这次更新在 MLX 后端上的改进堪称亮点。Unsloth 现已支持在 Apple Silicon 上使用 MLX 对大型 MoE(专家混合)模型进行文本或图像微调。
更关键的是速度提升:长 Qwen 对话在 Mac 上的运行速度大幅加快,后续轮次的响应速度最高提升可达 30 倍。这一数字对 Mac 用户来说极具吸引力,意味着本地大模型对话不再受制于漫长的等待。
此外,MLX 模型现在可以使用完整的上下文长度,并支持更长的批量生成;在多次生成之间以及模型切换时能更干净地释放 GPU 内存;同时还能通过 Unsloth 的 OpenAI 兼容 API 提供服务。GLM-5.3 的 MLX 微调结果也支持导出为 GGUF 格式,打通了微调到部署的完整链路。
音频多模态能力全面扩展
本次更新的另一大方向是音频支持的显著增强。Unsloth 新增了对 MiniMax-Music3、Higgs、MOSS 等音频模型的支持,覆盖了音乐生成与语音合成等多种场景。
在体验层面,音频生成过程现在提供实时进度更新,用户可以清晰看到生成状态;生成的音频片段还支持归档与管理。可靠性方面,团队修复了自定义 TTS 播放问题,加入了 Whisper 配对检查,并加强了音频测试。这些改进让 Unsloth 从一个纯文本微调工具,逐步演进为支持多模态生成的综合平台。
聊天、工具调用与Agent可靠性升级
在 Agent 与工具调用方面,这次更新解决了不少实际痛点:
- 并行工具调用:可以同时运行多个工具调用而不会混淆各自的参数,Unsloth 会在 JSON 对象边界处正确拆分并行工具调用的参数。
- 多模态工具保持:在使用图像聊天时仍能保持工具可用。
- MCP 连接持久化:每个聊天保持独立的 MCP 连接,从而实现更快的工具调用。
- 代码编辑能力:本地模型可以使用 Codex 的 apply_patch 工具编辑代码。
- Auto Compaction(自动压缩):支持在带有图像等媒体的长对话中通过自动压缩机制继续对话。
- Deep Research 审批:用户可在研究开始前审查并批准 Deep Research 计划。
这些改进针对的是 Agent 工作流中最容易出错的环节,体现了 Unsloth 在工程化可靠性上的持续打磨。
训练与硬件兼容性增强
在训练侧,Unsloth 强化了多 GPU 的规划能力,能够自动进行设备放置,将更大的模型跨多张显卡训练。改进后的规划器不再从某张卡上扣留拆分预留空间,并按物理核心进行定价,内存拟合更加合理。
硬件兼容性方面,AMD/ROCm 的检测、安装与 GPU 兼容性得到全面加强:AMD 安装会在 Windows 和 Linux 上自动选择最佳构建版本,并在更多 GPU 上支持 BF16;修复了 gfx10 系列 ROCm GPU 的 BF16 检测问题,以及分离式 Debian 技术栈上的 ROCm 检测问题。对于长期被兼容性困扰的 AMD 用户,这些修复无疑是好消息。
此外,用户现在可以自定义 GGUF 分片大小与保存位置,导出流程更加灵活可控。
API与桌面端体验优化
Unsloth Desktop 作为免费开源的桌面应用,本次也获得多项体验优化:
- 新增 OpenAI 兼容的 Videos API(
/v1/videos),可通过标准接口生成视频。 - 更新在后台下载,重启时自动安装,减少中断。
- 支持自定义端口以实现局域网访问。
- 模型下载显示更清晰的进度,并能在 Xet 下载停滞时自动切换到 HTTP。
整体而言,UI 更快、更少卡顿,后续对话轮次响应明显加速,聊天编辑也更安全,能够保留工具卡片、回复详情和对话分支。
总结
Unsloth 这次 v0.1.806-beta 更新,虽然以「2 倍速度」为宣传核心,但实际的价值远不止于此。从 MTP 推理加速、Apple Silicon 上的 MLX 优化,到音频多模态支持、Agent 工具可靠性以及 AMD 硬件兼容性的全面改进,170 多项改动勾勒出一个正在快速成熟的本地大模型工具链生态。
对于希望在本地或私有环境中运行、微调大模型的开发者来说,Unsloth 正在把「速度」「兼容性」和「易用性」这三件难事同时往前推进,值得持续关注。
相关推荐

Harbor:统一80+基准的AI Agent评估框架详解
深入解析Harbor Adapters和Harbor-Index如何通过统一适配器层整合80+基准测试,开展8模型×54基准的大规模AI Agent评估实验,并构建82个高质量任务的元数据集,推动Agent评估标准化。

日元跌破160关口:央行干预为何难挡贬值趋势
日元兑美元再度跌破160关键心理关口,日本央行外汇干预效果被迅速侵蚀。本文深入分析美日利差、套利交易、输入型通胀等核心因素,解读日元持续走弱的结构性原因及未来走势展望。

Grok代理模式实测:一句话自动生成完整视频流程详解
实测Grok 4.6代理模式,用一句话自动完成儿童睡眠视频制作全流程。详解图片生成、视频转换、配乐拼接的自动化效果,以及SUNO配乐协同和剪辑优化技巧。