LibriSpeech
基于LibriVox有声书的大规模英语语音识别基准数据集,包含约1000小时的语音数据,是ASR领域最常用的标准评测集之一
时间轴 (近 90 天)
在LibriSpeech基准上,Oído的词错误率(WER)为3.7(clean)和8.2(other),而Whisper tiny.en在笔记本上为6.3和15.9
论文在 LibriSpeech 数据集上进行验证,覆盖两种不同的 SpeechLLM,偏置词表最大规模达到 2000 词
PTC-Bias 当前实验主要基于英文 LibriSpeech 数据集和特定 SpeechLLM,在中文等其他语言、真实嘈杂环境及更大偏置词表下的表现仍有待验证
Conformer在LibriSpeech基准上相较于纯Transformer架构实现了约15%的相对错误率降低
当前业界顶尖系统在标准英语测试集 LibriSpeech 上的 WER 已降至 5% 以下
在 LibriSpeech 基准测试上顶尖系统 WER 已低于 2%,在 Switchboard 对话场景中通常为 5-8%,在多人会议场景(AMI、ICSI)中可能高达 15-25%
LibriSpeech、CommonVoice 等主流语音识别训练集大多来自朗读录音或受控环境,信噪比高、语速均匀、句子完整
全部知识事实 (7)
在LibriSpeech基准上,Oído的词错误率(WER)为3.7(clean)和8.2(other),而Whisper tiny.en在笔记本上为6.3和15.9
50%待验证论文在 LibriSpeech 数据集上进行验证,覆盖两种不同的 SpeechLLM,偏置词表最大规模达到 2000 词
50%待验证PTC-Bias 当前实验主要基于英文 LibriSpeech 数据集和特定 SpeechLLM,在中文等其他语言、真实嘈杂环境及更大偏置词表下的表现仍有待验证
50%待验证Conformer在LibriSpeech基准上相较于纯Transformer架构实现了约15%的相对错误率降低
50%待验证当前业界顶尖系统在标准英语测试集 LibriSpeech 上的 WER 已降至 5% 以下
50%待验证在 LibriSpeech 基准测试上顶尖系统 WER 已低于 2%,在 Switchboard 对话场景中通常为 5-8%,在多人会议场景(AMI、ICSI)中可能高达 15-25%
50%待验证LibriSpeech、CommonVoice 等主流语音识别训练集大多来自朗读录音或受控环境,信噪比高、语速均匀、句子完整
50%