[KongchangAI]
BenchmarkWord Error Rate / 词错误率

WER

语音识别领域最核心的评估指标,计算替换、删除、插入错误数之和除以参考文本总词数,WER<5%通常被视为接近人类水平

Core Facts

Timeline (last 90 days)

Oct 8

学术界通常用字符错误率(CER)和单词错误率(WER)衡量OCR质量,在标准印刷体数据集上这些指标已接近人类水平

Unverified50%
Oct 8

对于编码器-解码器模型,直接的双语微调在原始WER指标上表现最强

Unverified50%
Oct 6

一个务实的做法是先用标准激活函数训练出稳定基线,再逐步替换为PReLU或可训练Swish等轻量级方案,通过A/B对比验证是否改善WER

Unverified50%
Sep 28

LLM评判的过滤策略比内部指标更为激进,并在巴尔的摩和芝加哥两个BPC语料库上显著降低了伪标签训练集的词错误率(WER)

Unverified50%
Sep 17

词错率(WER)是衡量ASR系统准确性的核心指标,指识别结果中错误词数占参考文本总词数的比例

Unverified50%
Sep 17

在多人重叠发言或强噪声场景中,ASR的WER可飙升至30%以上

Unverified50%
Sep 17

主流商用ASR在安静环境下的WER可低至3%-5%

Unverified50%
Sep 17

音频维度评分涉及首次响应延迟(TTFF)、端到端延迟、语音合成自然度(MOS分)和背景噪声下的ASR识别错误率(WER)

Unverified50%
Sep 12

评估语音自然度的主流指标是平均意见得分(MOS),由真人评听员对样本打分(1-5分)

Unverified50%
Sep 12

OCR 准确率通常使用字符错误率(CER)和单词错误率(WER)两个指标衡量

Unverified50%

13 more timeline events

All Facts (20)

Verified

词错误率(WER)是语音识别领域最通用的性能指标,计算公式为(替换数+删除数+插入数)/参考文本总词数

90%
Verified

Gemini 3.5 Transcribe 是 Gemini 系列在语音处理方向的延伸,主打「精准」与「智能」两大核心能力

85%
Verified

词错误率(WER)的计算公式为 (替换数 + 删除数 + 插入数) / 参考文本总词数,WER 越低表示转录质量越高

75%
Verified

词错误率计算公式为 WER = (S + D + I) / N,其中 S 是替换错误数、D 是删除错误数、I 是插入错误数、N 是参考文本的总词数

65%
Verified

声音漂移是自回归语音生成模型中的已知技术难题,因逐步生成时误差会累积导致音色偏离目标说话者

65%
Verified

儿童声道更短,导致共振峰频率更高且变异性更大,是儿童ASR识别困难的原因之一

65%
Unverified

早期语音识别主流方案依赖隐马尔可夫模型(HMM),对噪声、口音和多语种混合识别能力有限

70%
Unverified

Gemini 3.5 Transcribe能自动去除口误、填充词,并识别口误修正只保留最终结果

60%
Unverified

学术界通常用字符错误率(CER)和单词错误率(WER)衡量OCR质量,在标准印刷体数据集上这些指标已接近人类水平

50%
Unverified

对于编码器-解码器模型,直接的双语微调在原始WER指标上表现最强

50%
Unverified

一个务实的做法是先用标准激活函数训练出稳定基线,再逐步替换为PReLU或可训练Swish等轻量级方案,通过A/B对比验证是否改善WER

50%
Unverified

LLM评判的过滤策略比内部指标更为激进,并在巴尔的摩和芝加哥两个BPC语料库上显著降低了伪标签训练集的词错误率(WER)

50%
Unverified

词错率(WER)是衡量ASR系统准确性的核心指标,指识别结果中错误词数占参考文本总词数的比例

50%
Unverified

在多人重叠发言或强噪声场景中,ASR的WER可飙升至30%以上

50%
Unverified

主流商用ASR在安静环境下的WER可低至3%-5%

50%
Unverified

音频维度评分涉及首次响应延迟(TTFF)、端到端延迟、语音合成自然度(MOS分)和背景噪声下的ASR识别错误率(WER)

50%
Unverified

评估语音自然度的主流指标是平均意见得分(MOS),由真人评听员对样本打分(1-5分)

50%
Unverified

OCR 准确率通常使用字符错误率(CER)和单词错误率(WER)两个指标衡量

50%
Unverified

在Code-switching(语言混合切换)场景下,当前最优语音识别模型的词错误率(WER)仍在15-25%之间,而英语单语场景WER在5%以内

50%
Unverified

在真实复杂场景(远场麦克风、多人重叠对话、强背景噪声)下 WER 可能飙升至 20%-40%

50%

Source Articles