Verified65% confidenceFactExact time
一次完整的语音AI交互涉及STT、LLM推理、TTS三个串行处理阶段
3
Sources
65%
Confidence
Long-term
Relevance
7/22/2026
First Seen
Sources
Related Claims
Unverified语音智能体技术栈通常包含STT(如Whisper)、LLM推理、TTS(如ElevenLabs)三个串行环节82% similarUnverified语音智能体技术栈通常包含STT、LLM推理、TTS三个串行环节,STT约耗时200-400ms,LLM首token延迟约100-500ms,TTS生成约100-300ms80% similarUnverifiedEnd-to-end latency in voice AI typically involves three stages: speech-to-text (STT) recognition, large language model inference, and text-to-speech (TTS) synthesis78% similarUnverified语音智能体典型系统架构由VAD、STT、意图识别/LLM推理、TTS等环节串联构成,工业界通常将端到端目标设定在首字节音频输出500ms以内77% similarUnverifiedMoonshine将语音转文本(STT)、意图识别、文本转语音(TTS)三项能力整合在同一框架中76% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/589575API
curl https://kongchang.com/api/v1/knowledge/claims/589575MCP
get_claim(id=589575)