待验证50% 置信事实精确时间
通用ASR模型的训练数据大多来自播客、有声书、YouTube视频等宽带高质量音频源,与呼叫中心的窄带嘈杂环境存在显著差异
1
来源数
50%
置信度
长期有效
时效性
2026/8/5
首次发现
来源
相关事实
待验证主流ASR系统(如Whisper、Google Speech-to-Text)主要在成人语音数据集上训练,在儿童语音上的词错误率通常比成人高出30%-50%71% 相似待验证紧急报警场景中的语音特征(高语速、气喘、哭泣、语句中断重叠)在主流ASR训练数据集中严重不足,形成显著的领域偏移问题69% 相似待验证当前主流ASR系统如OpenAI的Whisper、Google Speech-to-Text在面对口音、语速变化、背景噪音、专业术语等场景时错误率仍会显著上升68% 相似已验证Whisper、Wav2Vec 2.0等模型通过自监督预训练在海量无标注音频上学习通用声学表示,降低对人工标注数据的依赖68% 相似待验证音频token以重建高保真音频为训练目标,保留音色、情绪、环境音等全部声学信息,而非像ASR输出只保留语言内容68% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/692312API
curl https://kongchang.com/api/v1/knowledge/claims/692312MCP
get_claim(id=692312)