[控场AI]
· 10 分钟阅读· 5,307 字

语音识别远未解决:Mistral音频研究负责人深度解析

语音识别远未解决:Mistral音频研究负责人深度解析

Mistral音频负责人拆解Voxtral架构,直言语音识别在真实场景远未解决,并深度解析流式、分离与DPO等核心技术权衡。

本文基于对Mistral AI音频研究负责人Pavan Kumar Reddy的深度访谈,系统梳理了Mistral在语音领域的技术布局与核心判断。Voxtral Chat以文本模型为主干、音频编码器token直接输入解码器,实现端到端原生音频理解;TTS模型Voxtral则采用flow matching生成连续隐变量替代复杂的离散RVQ码本预测。在流式场景中,Mistral将"目标延迟"设计为可调参数,支持快慢双流并行的实用方案。说话人分离作为自回归任务内建进模型,但多说话人重叠语音仍是公认难题。DPO被用于提供负向监督,针对性修复无限循环、跳段等退化生成。Pavan最终给出了反直觉的务实判断:尽管演示效果亮眼,语音识别在非头部语言和嘈杂声学环境下的真实部署中远未达到"已解决"的水平,定制化微调和级联系统的可观测性仍有重要的实践价值。

语音是人类最古老的沟通方式,远早于文字的诞生。当下的AI语音技术在各种演示中看起来已经近乎完美,但Mistral AI的音频研究负责人Pavan Kumar Reddy却给出了一个反直觉的判断:语音识别(ASR)远未成为一个"已解决的问题"。在与播客主持人的深度对话中,他拆解了Mistral的音频模型架构、流式与批量的权衡、说话人分离的难题,以及语音技术在真实场景落地时暴露的种种短板。

从Voxtral到端到端语音模型:Mistral的音频布局

Mistral定位为一家"全栈AI公司",从模型层、应用层(Mistral Vibe编码工具、Vibe Work智能体工作平台)、AI Studio(API与智能体工作流)、Forge(微调与模型适配平台)到Mistral Compute(AI云算力),覆盖了AI技术栈的多个层次。Pavan领导的音频研究团队正是模型层的核心组成部分。

音频布局的起点是去年发布的Voxtral Chat——一个"音频输入、文本输出"的大语言模型。它不只是转录工具,而是一个通用的音频理解接口:你可以把一段长达数十分钟的财报电话会议或播客录音喂给它,然后像面对文本文档一样提问——对话的主题是什么?谁在什么时候发言?某个话题是在哪个时间点被提及的?

音频领域仍在快速演进

Pavan强调,这类"原生音频理解"与传统的级联方案(先转录成文本,再喂给聊天机器人)有本质区别。端到端处理消除了级联架构中的误差传播,而且能捕捉转录文本无法承载的信息,比如情绪。更关键的是,中间转录格式必须预先决定要保留哪些信息(比如时间戳粒度),而原生音频模型可以凭借注意力机制直接关注输入中真正相关的部分。

架构选择:简单配方的力量

Voxtral的架构体现了深度学习"乐高式"组合的理念。它以一个30亿参数的文本模型(Minstrel系列)作为主干(trunk),通过音频编码器将音频转为连续嵌入表示,再像文本token一样直接输入解码器——这与Whisper通过交叉注意力将编码器输出送入解码器的做法不同。编码器每80毫秒产出一个音频token,即每秒12.5个token的固定帧率。

Pavan反复强调团队对"简单配方"的偏好:recipe越简单,越经得起时间考验,也越容易扩展。模型端到端预训练,只用两个基础任务——交错的音频文本续写任务,以及用于对齐音频与文本模态的转录任务。即便在实时模型中融合音频与文本token,团队也选择了最简单的直接求和,而非更花哨的融合技术,"效果和那些复杂方法一样好"。

在生成端,Mistral今年3月发布的Voxtral TTS采用了decoder-only的transformer主干,以自回归方式预测连续隐变量,再由神经编解码器重建。为什么选择连续隐变量而非主流的离散token?Pavan解释,离散token方案(如EnCodec、SoundStream、Mimi)每个时间步需要预测一组残差向量量化码本,他们的场景多达30多个码本,意味着每个时间步要做30多步的"码本内自回归"。为简化这一复杂度,团队转向了基于flow matching的扩散方法——用一个flow head做速度场预测,推理时在固定步数内积分,步数可控,提供了更精细的质量-速度权衡。由于他们的神经编解码器纯粹用于生成而非通信压缩,离散码本的"带宽瓶颈"在此并无意义,连续嵌入反而能拓展设计空间。

梅尔频谱图是面向人类听觉的特征提取

关于输入特征的选择,Pavan坦承这是典型的归纳偏置权衡。在小模型场景下,梅尔频谱图这种面向人类听觉的特征提取提供了更高的样本效率;但随着模型和数据规模增大,这些预处理会变得不必要,直接喂入波形甚至去掉编码器正变得越来越常见——这既能让通用模型摆脱人为的归纳偏置找到更优解,也能让规模扩展更可预测。

Flow matching是近年兴起的生成建模范式,可视为扩散模型的一种简化与泛化。传统扩散模型通过逐步添加噪声再学习去噪来建模数据分布,而flow matching直接学习一个连续的速度场(velocity field),将噪声分布"流动"到数据分布。推理时,只需从随机噪声出发,按照学到的速度场做数值积分(如欧拉法),经过固定步数便能生成样本。相比扩散模型,flow matching的轨迹通常更短、更直,所需积分步数更少,推理效率更高。在TTS场景中,这意味着可以用少量推理步骤将连续隐空间中的随机噪声"流"成目标语音的隐表示,再交由神经编解码器重建波形,同时通过调整积分步数在生成质量与推理速度之间灵活权衡。

残差向量量化(RVQ)是主流神经音频编解码器(如EnCodec、Mimi)采用的离散化方案:将连续音频特征依次量化到多个码本,每个码本捕捉前一个的残差误差。层数越多(即码本越多),重建质量越高,但自回归预测时每个时间步需要顺序预测多个码本索引,显著增加了计算复杂度和生成延迟,这正是Mistral转向连续隐变量方案的直接动机。

流式与批量:质量与延迟的可控权衡

Pavan对音频领域的一个坦诚判断是:没有哪种架构是"最终形态",比文本领域更甚。流式模型的目标是让模型"持续聆听"而非分块处理,灵感部分来自Kyutai发布的延迟流建模,关键差异在于编码器是端到端从头训练的。

这里存在一个微妙的权衡:模型可以听完全部音频再输出转录(像Voxtral Chat和原版Whisper那样),也可以在听到"New York"后立即输出对应token。但立即输出会带来歧义——一个完整单词的前缀本身可能是独立的词,等待越久歧义越小、错误率越低。Mistral的巧妙之处是将"目标延迟"作为模型的一个参数,用户可以根据应用场景(字幕展示需要低延迟,归档记录可以容忍高延迟换取准确率)灵活控制,甚至同时开启多个不同延迟的流——快流即时显示,慢流随后修正。

主持人补充了实践者视角:可以在级联系统中叠加各种工程化的精炼层,比如用Claude对ASR转录做refinement,结合全文上下文纠正人名、技术术语的误识别,或注入自定义词汇表。Pavan回应,如果今天重做Voxtral Chat,它会是一个推理模型——能在自己的思维链中转录必要部分、做网络搜索、获取上下文消歧,再重新转录,这一切都能在单次模型调用中完成。

说话人分离:远未解决的硬骨头

Mistral把说话人分离(speaker diarization)直接内建进模型,作为自回归任务而非独立的head或数据流。在异步模型中,模型输出分段转录——起始时间、转录文本、结束时间,再加上说话人ID(speaker 0到speaker i),用相同的自回归损失训练。

模型可以同时追踪所有说话人

但Pavan直言这个问题"远未解决",尤其是两人以上的多说话人、有重叠语音的嘈杂环境。他甚至建议大家"共情"模型的难处:人类分离说话人时还有视觉输入、声源方位等辅助信号,而音频模型面对的是单声道、折叠后的音频流,还要辨认从未见过、声音可能相似的陌生人。真实对话充满重叠(并非整齐的轮流发言),模型不仅要识别出多人同时说话,还要分辨谁在说、各自说了什么。

主持人分享的实践观察印证了这点:流式模型比批量模型故障模式更多,常会"凭空"创造出第五、第六个说话人——这正是上下文不足的直接后果。关于著名的"鸡尾酒会问题",Pavan认为模型原则上可以做到超人水平(比如从房间多个麦克风同时追踪所有说话人),不必像人类那样一次只能聚焦一个声源,但当前性能距离理论上限仍有很大差距。

说话人分离(Speaker Diarization)是将一段多人音频按说话人身份切分并标注"谁在何时说话"的任务,与说话人识别(Speaker Recognition,判断"这是谁")和语音分离(Speech Separation,从混叠信号中还原各路声源)是相关但不同的子问题。传统管线式方案通常包含语音活动检测(VAD)、说话人嵌入提取(如d-vector、x-vector)和聚类三个独立模块,各模块误差会级联累积。近年来端到端方法(如EEND系列)尝试用单一神经网络直接输出说话人帧级标注,但在说话人数量未知、存在大量重叠语音时仍面临严峻挑战。Mistral将分离任务嵌入自回归文本生成框架的做法,使模型能利用语义上下文辅助判断说话人身份(如根据话题连贯性推断轮次),但也因此依赖足够长的上下文窗口——这正是流式场景中上下文受限导致"凭空创造说话人"问题的根源。

DPO修复幻觉:给模型以负向监督

自回归架构的固有局限会导致退化生成——一旦模型犯了几个错误,就倾向于"固执"下去,陷入无限循环、重复预测,或因初始错误脱离训练分布而整段跳过转录。Mistral用DPO(直接偏好优化)来修复这类问题。

配方相当简单:收集模型产生的退化生成作为"loser",生成正确版本作为"winner",组成偏好对直接训练。Pavan强调要保持"on-policy"——loser必须是目标模型真实会产生的生成,而非虚构的场景。

Pavan对DPO与监督微调(SFT)的本质差异给出了精彩解读:预训练和SFT提供的都是纯粹的正向监督,只强化"什么是对的",却没有机制说"这是错的、降低这个序列的概率"。DPO(以及RL相邻技术)恰好提供了负向监督的杠杆。从损失函数看,它像一个margin loss,把正样本推向更正、负样本压向更低,同时有一项约束防止模型偏离初始点太远——既修复微妙错误,又保留SFT阶段获得的能力。检测退化的方式则来自评测指标、错误模式观察和用户反馈的结合,未被现有评测捕捉的新错误模式往往提示需要构建新的eval。

DPO(Direct Preference Optimization,直接偏好优化)是2023年提出的一种RLHF替代方案。传统基于人类反馈的强化学习(RLHF)需要先训练一个独立的奖励模型,再用PPO等强化学习算法优化语言模型,流程复杂且不稳定。DPO将这一过程简化为直接在偏好数据对(winner/loser)上优化策略模型,通过隐式地将奖励函数表达为策略本身的对数比率,绕开了显式奖励模型的训练。其损失函数本质上是一个带KL约束的margin loss:拉高winner序列的相对概率,压低loser序列的相对概率,同时通过与参考模型的KL散度约束防止模型偏离太远、遗忘原有能力。在语音模型中,DPO的"负向监督"特性尤为重要:传统监督微调只能告诉模型"正确输出是什么",无法直接降低退化序列(如无限循环、跳段)的生成概率,而DPO提供了精确针对这类失败模式的训练信号。

真实世界才是前沿:语音技术的落地短板

当被问及语音技术的前沿在哪里,Pavan的回答出人意料地务实。尽管业界有很多"ASR已解决"的论调,但几周前与客户的交流中,最主要的抱怨恰恰是"在实际部署场景中远未解决"——即便是最主流的客服场景,模型仍会犯大量错误,企业不得不叠加大量脚手架来应对数百万次会话中的各种边角案例。

企业场景中的探索性产品应用

具体短板包括:模型在非头部语言上性能急剧下降(因为野外的英语音频数据远多于其他语言);在工厂车间等充满背景噪声、多人交谈的真实声学环境中表现不佳。这也正是"定制化"价值所在——音频模型足够小、可定制、实验成本低(不必微调一个万亿参数模型),企业用自己分布内的数据和高质量标注做微调,就能在特定场景获得"严格更优"的表现。Mistral的Forge平台正是为此而建,同时兼顾了会议录音等敏感数据的隐私需求。

关于端到端Omni模型与级联系统之争,Pavan给出了平衡的视角:当前的级联语音栈恰恰因为各组件以自然语言为接口而具备良好的可观测性与可解释性,企业可以叠加安全系统、追溯层和合规层,还能单独适配每个组件。对企业而言,"前沿"的标准是你的具体用例,而非外部benchmark。

对于语音的未来,Pavan认为它将成为与AI智能体交互的关键界面之一——就像今天组织中人与人之间委派工作、协作的方式。但主持人提出的"认知负债"观察也发人深省:纯音频界面在开放式任务(如邮件处理、研究)中反而低效,因为缺少视觉媒介带来的快速信息摄取、分支选择和对系统行为的确认。双方的共识是,未来更可能是视觉界面为主、语音为辅助增强的混合形态。至于音频模型是否天生不如文本模型聪明,Pavan明确表示这只是当前开发方式的产物,"没有任何根本原因"让单一模型的音频能力逊于文本能力。

分享:

相关推荐