Token Merging
一种推理阶段的Transformer加速技术,通过二分软匹配算法在每个Transformer层中识别并合并余弦相似度最高的冗余token,无需重新训练模型即可降低计算复杂度,最初用于加速视觉Transformer推理
Timeline (last 90 days)
一篇发表于 arXiv 的研究(arXiv:2609.13151v1)系统性地探讨了如何用 Token Merging 技术缓解多语种语音识别的效率瓶颈
Token Merging 作用于推理阶段,无需重新训练即可直接对已有模型生效,不改变模型权重
Token Merging(ToMe)最初由 Bolya 等人在 2022 年提出,用于加速视觉 Transformer(ViT)的图像分类推理
ToMe 借助 bipartite soft matching 算法,在每个 Transformer 层中找出余弦相似度最高的 token 对并合并为单个 token,该过程发生在注意力计算之前
该研究在 Whisper 模型家族上评估了 16 种不同语言和 3 种不同模型尺寸
实验结果显示在大多数低资源语言和各种模型尺寸下,Token Merging 提升了计算效率同时转录准确率几乎没有损失
研究证明 Token Merging 在模型经过 DoRA 微调之后依然有效,两种优化技术不相互干扰
工程团队可以先用 DoRA 针对目标语言优化模型,再叠加 Token Merging 获取效率收益
All Facts (8)
一篇发表于 arXiv 的研究(arXiv:2609.13151v1)系统性地探讨了如何用 Token Merging 技术缓解多语种语音识别的效率瓶颈
50%UnverifiedToken Merging 作用于推理阶段,无需重新训练即可直接对已有模型生效,不改变模型权重
50%UnverifiedToken Merging(ToMe)最初由 Bolya 等人在 2022 年提出,用于加速视觉 Transformer(ViT)的图像分类推理
50%UnverifiedToMe 借助 bipartite soft matching 算法,在每个 Transformer 层中找出余弦相似度最高的 token 对并合并为单个 token,该过程发生在注意力计算之前
50%Unverified该研究在 Whisper 模型家族上评估了 16 种不同语言和 3 种不同模型尺寸
50%Unverified实验结果显示在大多数低资源语言和各种模型尺寸下,Token Merging 提升了计算效率同时转录准确率几乎没有损失
50%Unverified研究证明 Token Merging 在模型经过 DoRA 微调之后依然有效,两种优化技术不相互干扰
50%Unverified工程团队可以先用 DoRA 针对目标语言优化模型,再叠加 Token Merging 获取效率收益
50%