[控场AI]
· 7 分钟阅读· 3,909 字

Transformers 5.17.0发布:新增6款模型与RoPE统一重构

Transformers 5.17.0发布:新增6款模型与RoPE统一重构

Transformers 5.17.0 新增六款前沿模型,统一视觉RoPE并优化解码性能,自定义视觉模型需注意破坏性迁移。

Hugging Face Transformers 5.17.0 版本在模型生态、基础设施优化和稳定性修复三条线上同步推进。模型层面新增六款:780B MoE 架构的 HYV4、混合线性注意力的 Kimi Linear、多模态编码器 NeoMME,以及语音合成 VibeVoice、识别模型 Fun-ASR-Nano 与 Canary-1B-v2、编解码器 NeuCodec。基础设施层面最重要的变化是视觉 2D/3D RoPE 被统一至集中模块,属于破坏性变更,自定义视觉模型必须迁移。生成性能上,停止每个解码步骤的加速器同步是最直接的提速手段,同时修复了无条件下载远程文件的问题。量化方面完善了 FP8 和 MXFP4 支持,AutoRound 新增 5/6/7 bit,内核层也修复了 FLA 导入、回退警告等多项细节。

Hugging Face Transformers 库发布了 5.17.0 版本,本次更新集中在新模型集成、视觉旋转位置编码(RoPE)标准化、生成性能优化以及大量量化与缓存层面的修复上。对于长期跟踪开源大模型生态的开发者而言,这个版本既带来了几款架构颇具野心的新模型,也包含一项需要注意的破坏性变更。

Transformers 5.17.0 发布页面

六款新模型集中登场

本次版本最吸睛的部分是模型库的扩容,涵盖语言、语音识别、语音合成和多模态检索等多个方向。

HYV4:780B 参数的 MoE 巨兽

Hy4-Preview 是一款 780B 参数的混合专家(MoE)语言模型,每个 token 仅激活 49B 参数。它的每个 MoE 层包含 256 个路由专家加 1 个始终激活的共享专家,每个 token 被路由到其中 8 个专家,上下文窗口达到 100 万 token。

其架构融合了四项技术:Multi-head Latent Attention(MLA)将键值压缩为低秩潜在表示;DeepSeek广告 Sparse Attention(DSA)通过轻量索引器为每个查询选择 top-k 键;带可学习注意力 sink 的门控 MLA,让每个头拥有参与 softmax 但不贡献数值的 sink logit(类似 GPT-OSS);以及独立超连接(iHC),用多条并行残差流替代传统的单一残差路径。值得一提的是,实现中并不执行多 token 预测(MTP)层,但发布的权重保留了这些参数,以便其他运行时用于推测解码。

混合专家(Mixture of Experts,MoE)是一种稀疏激活架构:模型总参数量很大,但处理每个 token 时只有部分"专家"子网络被路由器选中并激活,其余参数闲置。这使得模型可以用接近稠密小模型的计算量获得接近大模型的容量。HYV4 的 780B 总参数中,每个 token 仅激活 49B,激活比约为 6%,推理算力需求因此大幅低于同规模的稠密模型。

Multi-head Latent Attention(MLA)最早由 DeepSeek-V2 引入,核心思想是将 KV 缓存从"每头存储完整 K/V"压缩为一个共享的低秩潜在向量,再通过上投影矩阵在计算时还原,显著降低推理时的显存占用。独立超连接(iHC)则针对深层网络的梯度传播问题,用多条并行残差流代替单一残差路径,让不同粒度的特征可以独立流动而不互相干扰,是对 Transformer 标准残差连接的结构性扩展。

语音领域的三款新模型

语音方向一次性补齐了识别、合成与编解码三块拼图。VibeVoice 是一个在 LLM 结构内采用“下一 token 扩散”方法合成高保真长篇多说话人语音的框架,特别适合播客和多人有声书这类内容生成。

Fun-ASR-Nano 来自阿里达摩院 FunAudioLLM 团队,是一款 800M 参数的端到端语音识别模型,在中、英、日三语 ASR 基准上达到 SOTA,同时体积远小于同类模型。它支持 7 种中文方言、26 种地方口音,内置热词定制和原生标点输出,省去了单独的标点模型。

Canary-1B-v2 则来自 NVIDIA,是一款快速、鲁棒的多语言 ASR 与语音翻译模型,复用了 Parakeet 的 Fast Conformer 编码器,并通过解码器提示前缀切换转写或翻译任务。此外还有 NeuCodec 这款神经音频编解码器,采用有限标量量化(FSQ)实现单一码本设计,在 0.8kbps 的低比特率下保持传输鲁棒性,输入 16kHz、输出 24kHz。

KimiLinear 与 NeoMME

Kimi Linear 是月之暗面(Moonshot AI)推出的混合线性注意力架构,核心是 Kimi Delta Attention(KDA)——它在 Gated DeltaNet 基础上让每个键通道拥有独立的遗忘门,使循环状态按通道而非按头衰减。大部分层使用 KDA,每隔四层保留一个复用 DeepSeek-V3 MLA 的全注意力块。

NeoMME 则是 H Company 推出的 260M 和 800M 参数多模态原生多语言编码器家族,在单个双向 Transformer 编码器中同时处理多语言文本 token 和原始图像 patch,无需单独预训练的视觉塔。其衍生的 NeoMME-Retriever 专门针对视觉文档检索做了微调。

线性注意力是对标准 Softmax 注意力的一种近似替代,通过核函数分解将注意力的计算复杂度从序列长度的平方降至线性,代价是丢失部分精确的全局依赖建模能力。Gated DeltaNet 是线性注意力的一个变体,引入"遗忘门"控制历史状态的保留程度,解决了早期线性注意力在长序列上遗忘过快或无法更新的问题。Kimi Delta Attention 在此基础上将遗忘门细化到每个键的通道维度,让模型对不同语义特征有差异化的记忆衰减速率,理论上兼顾了长程记忆和局部精确度。混合架构(大部分层用线性注意力、间隔保留全注意力块)是目前平衡效率与质量的主流实践思路。

需要注意的破坏性变更

本次版本有一项明确的破坏性改动:视觉旋转位置编码(2D/3D RoPE)被统一到了集中的 RoPE 频率计算模块中。这意味着,如果你的自定义视觉模型依赖于注意力层级别或模型特定的 RoPE 网格交错逻辑,就必须迁移到新的 modeling_rope_utils.py 实现。对于维护定制视觉模型的团队而言,升级前务必评估这一改动的影响。

旋转位置编码(RoPE)通过将位置信息以旋转矩阵的形式编码进查询和键向量,使注意力分数天然包含相对位置关系,已成为当前主流 LLM 的标配位置编码方案。将其推广到视觉时,需要处理二维(图像的行列坐标)乃至三维(视频的时间轴)的网格结构,不同模型此前各自实现了不同的频率计算与坐标交错逻辑,导致代码分散且难以维护。本次将视觉 RoPE 统一到 modeling_rope_utils.py 的意义在于:后续所有视觉模型共享同一套经过验证的频率计算路径,降低因实现差异引入的精度偏差风险,但代价是依赖旧有注意力层级别逻辑的自定义实现必须同步迁移,否则会产生静默的数值错误或维度不匹配。

生成与缓存的性能优化

生成(Generation)模块的改进兼顾了性能与正确性。性能上,最关键的一点是停止在每个解码步骤同步加速器,直接降低了每一步的额外开销;同时修复了生成过程中无条件下载远程 hub 文件的问题。正确性方面,补齐了编码器-解码器模型的自动编译缓存检查,统一了 AfMoE 中 past_key_values 的命名,并修复了若干不稳定的测试。

缓存层面同样有一批修复,包括 VibeVoice 的量化缓存 bug、VoxtralRealtime 错误拒绝非静态缓存实现的问题,以及在没有缓存时调用分页注意力(paged attention)会静默失败——现在会主动抛出异常。文档也更新了 ContinuousBatchingConfig 的用法说明。

量化与内核的持续完善

量化方面修复了多个具体问题:Qwen 模型的 FP8 嵌入处理错误、缺失的 FP8 张量并行层覆盖,以及在 XPU 设备上不必要的 MXFP4 权重反量化。AutoRound 还新增了对 5/6/7 bit 的支持。

内核(Kernels)部分提升了灵活性:支持仅安装 fla-core 时的嵌套 FLA 内核导入;当 hub 内核函数静默回退到较慢的纯 PyTorch 参考实现时会发出一次警告;并允许在 KernelConfig 中注册独立函数(如 RoPE)且可选择不继承默认映射。此外还有数量可观的 bug 修复与测试稳定性改进,涵盖设备不匹配、梯度检查点、滑动窗口 mask 等多个细节。

FP8 是一种 8 位浮点格式(有 E4M3 和 E5M2 两种变体),相比 FP16/BF16 将权重和激活值的存储与计算带宽减半,是当前 H100/H200 等高端 GPU 上大模型推理与训练加速的重要手段。AutoRound 是一种基于符号梯度下降的后训练量化(PTQ)方法,通过对权重进行微小的舍入调整来最小化量化误差,此前主要支持 4 bit,新增 5/6/7 bit 意味着用户可以在精度与压缩比之间做更细粒度的权衡。FLA(Flash Linear Attention)内核则是线性注意力的硬件优化实现,类似 FlashAttention 之于标准注意力——通过重新组织计算顺序减少 HBM 访问次数,本次允许仅安装轻量级 fla-core 包即可嵌套使用相关内核,降低了环境依赖门槛。

小结

5.17.0 延续了 Transformers 一贯的高频迭代节奏:既有 HYV4、Kimi Linear 这类架构前沿的大模型落地,也有语音与多模态方向的务实补充。对普通用户来说,解码步骤不再同步加速器带来的推理加速、以及避免无条件下载远程文件的修复,是能直接感知的改进。而对自定义视觉模型的维护者,RoPE 统一重构则是升级时必须优先处理的迁移项。

分享:

相关推荐