待验证50% 置信基准精确时间
主流TTS方案如ElevenLabs、Azure Neural Voice和Google WaveNet的首字节延迟约为150-300毫秒
1
来源数
50%
置信度
中期 (~90 天)
时效性
2026/7/22
首次发现
有效期至:2026/10/20
来源
相关事实
待验证实时AI家教端到端延迟由ASR延迟(50-500ms)、LLM首Token生成延迟(100-2000ms)和TTS首音频帧延迟(50-300ms)三段叠加构成76% 相似待验证STT、LLM、TTS三段串行叠加,仅处理延迟就超过650毫秒,不包括服务间网络跳转耗时75% 相似待验证云端 TTS 服务的首字节响应时间通常为 200-500 毫秒,是延迟瓶颈的主要来源75% 相似待验证云端TTS服务的首字节响应时间通常200-500毫秒,本地部署的轻量TTS模型(如Piper、Kokoro-82M)可将延迟压至50毫秒以内,但音质通常略逊74% 相似待验证对语音响应速度要求高的场景不应选择仅靠云端唤醒的网关,本地唤醒词识别延迟通常在300ms内,而云端往返延迟常达1-2秒且受网络波动影响73% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/589577API
curl https://kongchang.com/api/v1/knowledge/claims/589577MCP
get_claim(id=589577)