STT
语音转文字(Speech-to-Text,STT),又称自动语音识别(ASR),是一种将人类口语音频信号自动转换为可读文本的技术。其核心依赖声学模型、语言模型和解码算法,能够识别连续自然语音、多语言及不同口音。广泛应用于语音助手、实时字幕、语音输入、电话客服分析等场景,是人机交互领域的基础技术之一。
核心事实
时间轴 (近 90 天)
低延迟和高识别率涉及语音活动检测(VAD)和语音转文字(STT)引擎的选型
在音频进入STT前加入降噪、去混响、音量归一化和VAD等预处理可显著提升下游转录质量
STT模型在低信噪比场景下不会承认听不清,而是倾向于编造合理但错误的词句(产生幻觉)
ODS 集成了语音交互能力,支持语音转文本(STT)和文本转语音(TTS)
构建语音产品时开发者通常需要拼接多个供应商的 STT、LLM 和 TTS 服务,每接入一家服务商意味着一套独立的 API 文档、鉴权、计费和错误处理逻辑
不同 TTS 引擎在自然度、延迟、语种覆盖上各有优劣,不同 STT 引擎在噪声环境、口音识别上表现不一
一个能打电话的AI Agent通常由语音识别(STT)、对话大脑(LLM)、语音合成(TTS)三层能力组成
该项目通过前置STT和后置TTS的精细优化,实现了大约0.3秒左右的响应延迟
三明治架构的核心思路是把大语言推理模型(LLM)夹在中间,前面加STT模型负责语音识别,后面加TTS模型负责语音播报
End-to-end latency in voice AI typically involves three stages: speech-to-text (STT) recognition, large language model inference, and text-to-speech (TTS) synthesis
还有 3 条时间轴事件
全部知识事实 (13)
传统语音AI普遍采用级联式架构,先用ASR将语音转文字,再交给语言模型处理,最后用TTS合成输出
75%已验证一次完整的语音AI交互涉及STT、LLM推理、TTS三个串行处理阶段
65%已验证早期ChatGPT语音采用级联架构,先语音转文字、再由大语言模型生成回答、最后转成语音播出
65%待验证ODS 集成了语音交互能力,支持语音转文本(STT)和文本转语音(TTS)
60%待验证End-to-end latency in voice AI typically involves three stages: speech-to-text (STT) recognition, large language model inference, and text-to-speech (TTS) synthesis
60%待验证低延迟和高识别率涉及语音活动检测(VAD)和语音转文字(STT)引擎的选型
50%待验证在音频进入STT前加入降噪、去混响、音量归一化和VAD等预处理可显著提升下游转录质量
50%待验证STT模型在低信噪比场景下不会承认听不清,而是倾向于编造合理但错误的词句(产生幻觉)
50%待验证构建语音产品时开发者通常需要拼接多个供应商的 STT、LLM 和 TTS 服务,每接入一家服务商意味着一套独立的 API 文档、鉴权、计费和错误处理逻辑
50%待验证不同 TTS 引擎在自然度、延迟、语种覆盖上各有优劣,不同 STT 引擎在噪声环境、口音识别上表现不一
50%待验证一个能打电话的AI Agent通常由语音识别(STT)、对话大脑(LLM)、语音合成(TTS)三层能力组成
50%待验证该项目通过前置STT和后置TTS的精细优化,实现了大约0.3秒左右的响应延迟
50%待验证三明治架构的核心思路是把大语言推理模型(LLM)夹在中间,前面加STT模型负责语音识别,后面加TTS模型负责语音播报
50%