已验证65% 置信事实精确时间
一次完整的语音AI交互涉及STT、LLM推理、TTS三个串行处理阶段
3
来源数
65%
置信度
长期有效
时效性
2026/7/22
首次发现
来源
相关事实
待验证语音智能体技术栈通常包含STT(如Whisper)、LLM推理、TTS(如ElevenLabs)三个串行环节82% 相似待验证语音智能体技术栈通常包含STT、LLM推理、TTS三个串行环节,STT约耗时200-400ms,LLM首token延迟约100-500ms,TTS生成约100-300ms80% 相似待验证End-to-end latency in voice AI typically involves three stages: speech-to-text (STT) recognition, large language model inference, and text-to-speech (TTS) synthesis78% 相似待验证语音智能体典型系统架构由VAD、STT、意图识别/LLM推理、TTS等环节串联构成,工业界通常将端到端目标设定在首字节音频输出500ms以内77% 相似待验证Moonshine将语音转文本(STT)、意图识别、文本转语音(TTS)三项能力整合在同一框架中76% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/589575API
curl https://kongchang.com/api/v1/knowledge/claims/589575MCP
get_claim(id=589575)