待验证50% 置信事实精确时间
传统TTS方案需要先生成完整音频文件再播放,延迟通常在数秒到十几秒之间
1
来源数
50%
置信度
长期有效
时效性
2026/9/5
首次发现
来源
涉及实体
相关事实
待验证云端TTS服务的首字节响应时间通常200-500毫秒,本地部署的轻量TTS模型(如Piper、Kokoro-82M)可将延迟压至50毫秒以内,但音质通常略逊77% 相似待验证实时AI家教端到端延迟由ASR延迟(50-500ms)、LLM首Token生成延迟(100-2000ms)和TTS首音频帧延迟(50-300ms)三段叠加构成75% 相似待验证传统语音交互的整个链路延迟通常在3-8秒,而实时媒体流可将端到端延迟压缩到数百毫秒级别75% 相似待验证主流TTS方案如ElevenLabs、Azure Neural Voice和Google WaveNet的首字节延迟约为150-300毫秒75% 相似待验证独立式广播定时器的录音容量普遍在10-30秒/段,若需播放主人完整安抚语句或长指令,应选支持≥60秒单段录音或支持MP3/TF卡外部导入的机型74% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/860604API
curl https://kongchang.com/api/v1/knowledge/claims/860604MCP
get_claim(id=860604)