MOSS-Transcribe-Diarize:0.9B端到端多说话人语音转写模型

一体化解决长语音转写难题
语音识别(ASR)领域长期存在一个痛点:处理多人对话的长音频时,传统流程往往需要将转写(Transcribe)和说话人分离(Diarization)拆分为两个独立环节,再加上繁琐的音频切片(chunking)操作,工程复杂度高且容易累积误差。
**说话人分离(Speaker Diarization)**是语音处理领域的经典难题,其目标是回答「谁在何时发言」。传统方案通常依赖聚类算法(如谱聚类、贝叶斯信息准则)对说话人嵌入向量进行分组,代表系统包括 pyannote.audio 和 NVIDIA NeMo。这类方案的核心瓶颈在于:转写模块与分离模块各自独立优化,两者在边界处的对齐误差会随管线长度累积,在说话人频繁切换或重叠语音场景下尤为明显。
近日,MosiAI 团队开源的 MOSS-Transcribe-Diarize-0.9B 给出了一个颇具吸引力的答案。这是一款仅 0.9B 参数的端到端模型,专为长时段、多说话人的语音识别场景设计。值得关注的是,SGLang 已提供 Day-0 支持,开发者可以在模型发布当天直接上手部署。
从命名便能看出这款模型的定位——它将「转写」与「说话人分离」两大任务合二为一,用单一模型完成过去需要多个组件串联才能实现的工作。
核心能力:音频进,结构化文本出
端到端结构化输出
MOSS-Transcribe-Diarize 最核心的设计理念是「音频输入,结构化文本输出」。模型直接输出带有时间戳和说话人标签的文本,无需额外依赖独立的音频切片或说话人分离模块。
这意味着开发者不必再为「谁在什么时间说了什么」搭建复杂的后处理管线。对于会议记录、播客转写、访谈整理等场景,这种一体化能力可以显著降低工程成本,同时避免多模块串联带来的误差传播。
精巧的模型架构
在架构上,MOSS-Transcribe-Diarize 采用了成熟组件的有效组合:
- 编码器:基于 Whisper-Medium 编码器,继承了 OpenAI Whisper 在语音特征提取上的优势;
- 解码器:采用 Qwen3-0.6B 风格的解码器,借助大语言模型的文本生成与理解能力输出结构化结果。
OpenAI 于 2022 年发布的 Whisper 是迄今最具影响力的开源 ASR 系统之一,其编码器采用卷积下采样 + Transformer 架构,在 68 万小时多语言弱监督数据上训练而来。Whisper-Medium 拥有约 3 亿参数的编码器部分,在多语言鲁棒性和噪声环境下的泛化能力上表现突出。将其作为声学前端,意味着 MOSS 无需从头训练声学模型,直接继承了 Whisper 数年工程积累的特征提取能力,大幅降低了训练成本。
「语音编码器 + LLM 解码器」的组合,是当前语音大模型的主流范式。将预训练语音编码器与大语言模型解码器对接,是 2023 年以来语音大模型的核心路线——Qwen-Audio、Gemini Audio、Phi-4-audio 等均采用类似设计:编码器将音频压缩为连续表示向量,随后通过投影层(projector)映射到 LLM 的词嵌入空间,由 LLM 负责序列生成。这一设计的关键优势在于:LLM 的自回归生成天然具备上下文建模能力,能够在生成转写文本的同时维持说话人标签的语义一致性,而纯声学系统难以做到这一点。它既保留了 Whisper 在声学建模上的成熟度,又充分利用了 Qwen3 系列在语言建模上的能力,Qwen3-0.6B 紧凑的参数规模也是最终模型控制在 0.9B 以内的关键。
长音频处理与实用特性
128K 上下文,单次处理 90 分钟音频
对长音频的支持是这款模型的核心亮点。凭借 128K 的上下文长度,MOSS-Transcribe-Diarize 可以在**单次前向传播(one pass)**中处理长达约 90 分钟的音频。
这一数字背后有明确的技术逻辑:以 Whisper 的音频编码方式为参考,30 秒音频通常对应约 1500 个声学 token,128K token 的上下文窗口因此恰好覆盖约 90 分钟的连续音频。相比之下,原版 Whisper 的单次处理窗口仅为 30 秒,需要通过滑动窗口拼接处理长音频,而窗口边界处的说话人身份信息无法跨段传递,导致同一说话人在不同片段中可能被赋予不同标签。128K 长上下文从根本上消除了这一局限,使模型能在全局视野下维持说话人身份的时序一致性,从而提升转写质量与分离准确率。
热词增强,应对专有名词与中英混说
实际应用中,人名、专业术语、品牌名等专有名词往往是 ASR 的难点,中英文夹杂(code-switching)的场景更是如此。MOSS-Transcribe-Diarize 内置**热词增强(Hotword Boosting)**功能,用户可以针对特定名称、领域术语及混合语言场景提升识别准确率。
热词增强的工作原理值得一提:在基于 LLM 的端到端系统中,热词通常以提示词(prompt)形式注入上下文,引导模型在生成时优先选择目标词汇。这对中英混合场景尤为重要——模型需要同时处理两种语言的音素映射,而专有名词(如人名「Elaine」、产品名「Kubernetes」)往往不在训练语料的高频词表中,热词机制能有效弥补这一分布外问题,使关键术语和人名的识别准确率大幅提升,真正发挥转写的实用价值。
轻量化与部署友好
0.9B 参数,支持边缘设备部署
在大模型动辄数十乃至上百亿参数的背景下,MOSS-Transcribe-Diarize 仅 0.9B 参数的体量显得格外克制。这一轻量化设计赋予了其**边缘/端侧(edge/on-device)**部署的可能性。
端侧部署意味着更低的延迟、更好的数据隐私保护以及更低的运营成本。对于需要本地化处理敏感语音数据的场景(如医疗、法律、金融),脱离云端运行的能力尤为关键。0.9B 的参数规模在现代移动端 NPU 或桌面级 GPU 上均可流畅运行,为语音 AI 的本地化部署打开了切实可行的技术路径。
Day-0 的 SGLang 支持
模型发布即获得 SGLang 的 Day-0 原生支持,这对开发者社区极为友好。SGLang(Structured Generation Language)是由学术界与工业界共同推动的高性能 LLM 推理框架,专为结构化输出和高吞吐场景优化,核心特性包括 RadixAttention(KV 缓存共享)、Continuous Batching 和原生结构化输出约束。对于 MOSS 这类输出格式固定(时间戳 + 说话人标签 + 文本)的模型,SGLang 的结构化生成能力能显著减少无效 token 的采样开销。Day-0 支持意味着模型架构在设计阶段就与 SGLang 完成对接适配,避免了社区自行适配时常见的精度损失或性能退化问题。官方还提供了配套 Cookbook 文档,帮助开发者快速上手。
「开源 + 主流推理框架首发支持 + 完整文档」的组合,大幅降低了尝试门槛,也体现了团队对生态落地的重视。
总结与展望
MOSS-Transcribe-Diarize-0.9B 代表了语音识别领域的一个清晰趋势:用统一的端到端模型替代复杂的多组件管线。在有限的参数规模下,它同时实现了长音频处理、多说话人分离、时间戳标注、热词增强等一系列实用能力,且完全开源、部署友好。
当然,作为一款新发布的模型,其在真实业务场景下的准确率、对不同语言和口音的适应能力,以及与商业方案的对比表现,还有待社区更广泛的验证。但无论如何,一个 0.9B 的开源端到端多说话人 ASR 模型,为开发者提供了高性价比的选择,也为语音 AI 的端侧落地打开了新的想象空间。
核心要点
相关推荐

Go微服务实战:商城、AI Agent与IM系统集成架构详解
深入解析Go微服务架构下商城、AI Agent与IM即时通讯系统的集成方案,涵盖统一鉴权、gRPC通信、组件化Agent引擎设计、群聊机器人等生产级落地场景,适合希望掌握存量系统集成能力的Go开发者。

X平台推荐算法被曝过滤巴西选举内容,算法透明度再引争议
X平台(原Twitter)被用户发现在For You推荐流中过滤巴西选举相关内容,引发算法透明度与言论自由争议。本文深入分析事件背景、技术实现方式及对平台治理的深层影响。

抗投毒概念锚定:防御AI数据污染的新思路
深入解析Poison-Resistant Concept Anchoring方案,通过签名锚点与有界更新机制防御数据投毒攻击。实验显示该方法可隔离62%投毒数据,同时保持0%正常数据误拦率,为联邦学习和开源模型协作提供可行的安全防御框架。