STT
语音转文字(Speech-to-Text,STT),又称自动语音识别(ASR),是一种将人类口语音频信号自动转换为可读文本的技术。其核心依赖声学模型、语言模型和解码算法,能够识别连续自然语音、多语言及不同口音。广泛应用于语音助手、实时字幕、语音输入、电话客服分析等场景,是人机交互领域的基础技术之一。
Core Facts
Timeline (last 90 days)
低延迟和高识别率涉及语音活动检测(VAD)和语音转文字(STT)引擎的选型
在音频进入STT前加入降噪、去混响、音量归一化和VAD等预处理可显著提升下游转录质量
STT模型在低信噪比场景下不会承认听不清,而是倾向于编造合理但错误的词句(产生幻觉)
ODS 集成了语音交互能力,支持语音转文本(STT)和文本转语音(TTS)
构建语音产品时开发者通常需要拼接多个供应商的 STT、LLM 和 TTS 服务,每接入一家服务商意味着一套独立的 API 文档、鉴权、计费和错误处理逻辑
不同 TTS 引擎在自然度、延迟、语种覆盖上各有优劣,不同 STT 引擎在噪声环境、口音识别上表现不一
一个能打电话的AI Agent通常由语音识别(STT)、对话大脑(LLM)、语音合成(TTS)三层能力组成
该项目通过前置STT和后置TTS的精细优化,实现了大约0.3秒左右的响应延迟
三明治架构的核心思路是把大语言推理模型(LLM)夹在中间,前面加STT模型负责语音识别,后面加TTS模型负责语音播报
End-to-end latency in voice AI typically involves three stages: speech-to-text (STT) recognition, large language model inference, and text-to-speech (TTS) synthesis
3 more timeline events
All Facts (13)
传统语音AI普遍采用级联式架构,先用ASR将语音转文字,再交给语言模型处理,最后用TTS合成输出
75%Verified一次完整的语音AI交互涉及STT、LLM推理、TTS三个串行处理阶段
65%Verified早期ChatGPT语音采用级联架构,先语音转文字、再由大语言模型生成回答、最后转成语音播出
65%UnverifiedODS 集成了语音交互能力,支持语音转文本(STT)和文本转语音(TTS)
60%UnverifiedEnd-to-end latency in voice AI typically involves three stages: speech-to-text (STT) recognition, large language model inference, and text-to-speech (TTS) synthesis
60%Unverified低延迟和高识别率涉及语音活动检测(VAD)和语音转文字(STT)引擎的选型
50%Unverified在音频进入STT前加入降噪、去混响、音量归一化和VAD等预处理可显著提升下游转录质量
50%UnverifiedSTT模型在低信噪比场景下不会承认听不清,而是倾向于编造合理但错误的词句(产生幻觉)
50%Unverified构建语音产品时开发者通常需要拼接多个供应商的 STT、LLM 和 TTS 服务,每接入一家服务商意味着一套独立的 API 文档、鉴权、计费和错误处理逻辑
50%Unverified不同 TTS 引擎在自然度、延迟、语种覆盖上各有优劣,不同 STT 引擎在噪声环境、口音识别上表现不一
50%Unverified一个能打电话的AI Agent通常由语音识别(STT)、对话大脑(LLM)、语音合成(TTS)三层能力组成
50%Unverified该项目通过前置STT和后置TTS的精细优化,实现了大约0.3秒左右的响应延迟
50%Unverified三明治架构的核心思路是把大语言推理模型(LLM)夹在中间,前面加STT模型负责语音识别,后面加TTS模型负责语音播报
50%