Unverified50% confidenceFactExact time
语音识别通常包含声学模型和语言模型两个阶段,声学模型将音频波形转换为音素或文本序列,语言模型负责纠错、断句和标点插入
1
Sources
50%
Confidence
Medium-term (~90 days)
Relevance
7/2/2026
First Seen
Valid until: 9/30/2026
Sources
XiaoWu Voice Input Method: Powered by Local LLMs for Accurate Offline Speech Recognition
bilibilii-xiaowu6/23/2026
Related Claims
Unverified工作流提供对口型模式(将用户语音冻结进音频潜空间)和模型生成语音模式两种语音生成方式82% similarVerified端到端语音模型直接以音频为输入和输出,在音频token层面进行理解与生成,保留语调、语速、叹气、笑声等声学特征81% similarUnverified新模型能感知说话者的音量、语气等副语言信息,并主动调大音量或切换状态78% similarUnverifiedVALL-E、VoiceCraft等语音合成模型采用了将语音表示为Token序列并使用自回归生成框架的技术路线78% similarUnverified本地化语音识别需要在模型体积与识别精度之间做取舍,WER数字需结合具体场景解读,真实场景中的口语化表达、噪音、口音、领域术语会拉大不同模型的性能差距77% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/41192API
curl https://kongchang.com/api/v1/knowledge/claims/41192MCP
get_claim(id=41192)