Whisper
Whisper是由OpenAI开发并开源的自动语音识别(ASR)模型,能够将音频内容转录为文字,并支持多种语言的语音识别与翻译。该模型基于大规模多语言语音数据训练,具备较强的噪音鲁棒性,可处理多种口音和语言风格,适用于字幕生成、语音助手、会议记录等场景。
Core Facts
Timeline (last 90 days)
受益于Whisper等大规模多语言ASR模型及Transformer架构翻译模型,AI字幕翻译端到端延迟可控制在1-3秒以内
Speechmark 实现离线运行依托于 Apple Silicon 芯片的神经网络引擎以及 Whisper 等开源语音识别模型的轻量化优化
语音AI的工程生态如Whisper、Kaldi、ESPnet几乎都构建在Python之上,其中Kaldi核心用C++编写但提供Python接口,ESPnet基于PyTorch
OpenAI的Whisper采用Transformer架构,在大规模多语言数据上进行预训练
在AliMeeting、ASR等多个多语者基准上,VibeVoice的WER/CER错误率低于Gemini、GPT Realtime、Whisper及ElevenLabs Scribe等主流实时转写方案
Whisper已迭代至large-v3版本(2023年11月),在Fleurs基准测试上的平均词错误率(WER)降至约10%以下
Whisper 的 tiny 或 base 变体参数量从39M到74M不等,配合 INT8 量化可将模型体积压缩至原来的1/4
OpenAI Whisper作为当前主流ASR引擎的词错率已降至5%以下
本地Whisper模型在消费级GPU上实时转录速度约为音频时长的1/4到1/10,处理35,000小时内容可能需要数月
AI会议助手工具的底层技术大多基于ASR(自动语音识别)引擎,如OpenAI的Whisper、Google的Speech-to-Text
22 more timeline events
All Facts (20)
Whisper是OpenAI于2022年开源的自动语音识别模型,采用Transformer架构,在68万小时多语言音频数据上训练而成
80%Verified语音识别技术经历了从隐马尔可夫模型(HMM)到循环神经网络(RNN)再到端到端模型的演进
70%VerifiedOpenAI 开源的 Whisper 模型有多个尺寸版本,从39M参数的tiny版本到1550M参数的large-v3版本,支持近百种语言
65%Verifiedfaster-whisper通过将Whisper模型转换为CTranslate2格式,在保持准确率基本不变前提下推理速度可提升约4倍
65%VerifiedOpenAI 开源的 Whisper 模型在 99 种语言上实现接近人类水平的词错率,并原生支持时间戳输出
65%VerifiedAzure OpenAI Service为企业客户提供了在合规环境中调用GPT-4、DALL-E、Whisper等模型的能力
65%VerifiedWhisper基于Transformer编码器-解码器架构,在68万小时的多语言标注音频数据上进行弱监督训练
65%VerifiedOpenAI开源的Whisper是本地化ASR方案的代表,可在消费级GPU上实时处理音频
65%VerifiedOpenAI 于 2022 年发布 Whisper,基于 Transformer 编码器-解码器架构,编码器处理 80 维 Mel 频谱图
65%Partially VerifiedOpenAI's Whisper speech recognition engine has achieved near-human-level recognition accuracy.
75%UnverifiedOpenAI Whisper large-v3模型支持99种语言,中文识别词错率约5-8%(清晰音源),是目前开源方案的准确率天花板
75%Unverified视频包装环节使用Code Agent,可调用FFmpeg、MoviePy等视频处理库和Whisper语音识别模型自动生成字幕
70%UnverifiedSpeechmark 实现离线运行依托于 Apple Silicon 芯片的神经网络引擎以及 Whisper 等开源语音识别模型的轻量化优化
60%UnverifiedWhisper是编码器-解码器(encoder-decoder)结构
50%Unverified研究选用了三类ASR架构:MMS(纯编码器)、Whisper(编码器-解码器)和Qwen3-ASR(基于大语言模型)
50%Unverified受益于Whisper等大规模多语言ASR模型及Transformer架构翻译模型,AI字幕翻译端到端延迟可控制在1-3秒以内
50%Unverified语音AI的工程生态如Whisper、Kaldi、ESPnet几乎都构建在Python之上,其中Kaldi核心用C++编写但提供Python接口,ESPnet基于PyTorch
50%UnverifiedOpenAI的Whisper采用Transformer架构,在大规模多语言数据上进行预训练
50%Unverified在AliMeeting、ASR等多个多语者基准上,VibeVoice的WER/CER错误率低于Gemini、GPT Realtime、Whisper及ElevenLabs Scribe等主流实时转写方案
50%UnverifiedWhisper已迭代至large-v3版本(2023年11月),在Fleurs基准测试上的平均词错误率(WER)降至约10%以下
50%