已验证65% 置信事实时间未知
传统语音交互系统中,语音携带的情感、语气、语速等副语言信息在ASR阶段转换为纯文本时会彻底丢失
3
来源数
65%
置信度
长期有效
时效性
2026/6/1
首次发现
来源
开源AI桌宠小猫:Qwen 3.5 Omni+ESP32打造全模态智能伙伴
bilibiliAI研究室-帆哥
涉及实体
相关事实
待验证语音被转换为文字中间表示时,原始音频中约40%的信息随之消失,包括情绪、强调、语速等副语言信息83% 相似待验证当前主流ASR系统如OpenAI的Whisper、Google Speech-to-Text在面对口音、语速变化、背景噪音、专业术语等场景时错误率仍会显著上升75% 相似待验证语音发音功能须区分TTS机器合成音与真人发音库,真人录制发音对学习地道口语更有价值,机器合成音在小语种上常出现重音错误74% 相似待验证端到端语音架构省去了ASR→LLM→TTS的传统三段式流水线,降低延迟并保留语调、情感等副语言信息74% 相似待验证音频token以重建高保真音频为训练目标,保留音色、情绪、环境音等全部声学信息,而非像ASR输出只保留语言内容74% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/17980API
curl https://kongchang.com/api/v1/knowledge/claims/17980MCP
get_claim(id=17980)