待验证50% 置信事实精确时间
多数语音模型的训练数据以单语种为主,混读语料相对稀缺
1
来源数
50%
置信度
长期有效
时效性
2026/9/18
首次发现
来源
涉及实体
相关事实
待验证传统n-gram模型和单语训练的神经语言模型在遇到跨语言词序列时会给出极低的概率分数,导致解码器倾向于将外语词强行映射为发音相近的本语言词79% 相似待验证端到端语音翻译需要大量源语言语音与目标语言文本的对齐数据,在低资源语言对中极为稀缺76% 相似待验证传统三段式语音管线中每个模块独立训练,误差会逐级累积,且文字化过程会不可逆地丢失说话者的语调、停顿、情绪等副语言信息76% 相似待验证跨语言迁移学习使模型在高资源语言上积累的声学知识能迁移至低资源语言,是单一模型支撑83种语言并保持一致音质的核心机制75% 相似待验证传统语音识别中的语言模型通常是轻量级N-gram模型或小型RNN,能力有限74% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/931786API
curl https://kongchang.com/api/v1/knowledge/claims/931786MCP
get_claim(id=931786)