待验证50% 置信事实精确时间
流式STT在用户说话过程中就持续输出部分识别结果,而批量模式需等待完整音频才能开始处理
1
来源数
50%
置信度
长期有效
时效性
2026/8/5
首次发现
来源
相关事实
已验证一次完整的语音AI交互涉及STT、LLM推理、TTS三个串行处理阶段74% 相似待验证语音AI系统中的中断处理需要在毫秒级别内完成停止TTS音频流、丢弃未播放内容、重置LLM上下文状态、重新进入STT监听模式等操作73% 相似待验证此前版本的ChatGPT语音模式对停顿容忍度较低,检测到语音中断后往往立即判定用户已说完并开始回应72% 相似待验证语音智能体典型系统架构由VAD、STT、意图识别/LLM推理、TTS等环节串联构成,工业界通常将端到端目标设定在首字节音频输出500ms以内69% 相似待验证语音智能体技术栈通常包含STT、LLM推理、TTS三个串行环节,STT约耗时200-400ms,LLM首token延迟约100-500ms,TTS生成约100-300ms69% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/688893API
curl https://kongchang.com/api/v1/knowledge/claims/688893MCP
get_claim(id=688893)