[控场AI]
概念Speech-to-Text / 语音转文本

STT

语音转文字(Speech-to-Text,STT),又称自动语音识别(ASR),是一种将人类口语音频信号自动转换为可读文本的技术。其核心依赖声学模型、语言模型和解码算法,能够识别连续自然语音、多语言及不同口音。广泛应用于语音助手、实时字幕、语音输入、电话客服分析等场景,是人机交互领域的基础技术之一。

核心事实

时间轴 (近 90 天)

9月17日

低延迟和高识别率涉及语音活动检测(VAD)和语音转文字(STT)引擎的选型

待验证50%
9月17日

在音频进入STT前加入降噪、去混响、音量归一化和VAD等预处理可显著提升下游转录质量

待验证50%
9月17日

STT模型在低信噪比场景下不会承认听不清,而是倾向于编造合理但错误的词句(产生幻觉)

待验证50%
9月11日

ODS 集成了语音交互能力,支持语音转文本(STT)和文本转语音(TTS)

待验证60%
9月11日

构建语音产品时开发者通常需要拼接多个供应商的 STT、LLM 和 TTS 服务,每接入一家服务商意味着一套独立的 API 文档、鉴权、计费和错误处理逻辑

待验证50%
9月11日

不同 TTS 引擎在自然度、延迟、语种覆盖上各有优劣,不同 STT 引擎在噪声环境、口音识别上表现不一

待验证50%
9月11日

一个能打电话的AI Agent通常由语音识别(STT)、对话大脑(LLM)、语音合成(TTS)三层能力组成

待验证50%
8月31日

该项目通过前置STT和后置TTS的精细优化,实现了大约0.3秒左右的响应延迟

待验证50%
8月31日

三明治架构的核心思路是把大语言推理模型(LLM)夹在中间,前面加STT模型负责语音识别,后面加TTS模型负责语音播报

待验证50%
8月4日

End-to-end latency in voice AI typically involves three stages: speech-to-text (STT) recognition, large language model inference, and text-to-speech (TTS) synthesis

待验证60%

还有 3 条时间轴事件

全部知识事实 (13)

已验证

传统语音AI普遍采用级联式架构,先用ASR将语音转文字,再交给语言模型处理,最后用TTS合成输出

75%
已验证

一次完整的语音AI交互涉及STT、LLM推理、TTS三个串行处理阶段

65%
已验证

早期ChatGPT语音采用级联架构,先语音转文字、再由大语言模型生成回答、最后转成语音播出

65%
待验证

ODS 集成了语音交互能力,支持语音转文本(STT)和文本转语音(TTS)

60%
待验证

End-to-end latency in voice AI typically involves three stages: speech-to-text (STT) recognition, large language model inference, and text-to-speech (TTS) synthesis

60%
待验证

低延迟和高识别率涉及语音活动检测(VAD)和语音转文字(STT)引擎的选型

50%
待验证

在音频进入STT前加入降噪、去混响、音量归一化和VAD等预处理可显著提升下游转录质量

50%
待验证

STT模型在低信噪比场景下不会承认听不清,而是倾向于编造合理但错误的词句(产生幻觉)

50%
待验证

构建语音产品时开发者通常需要拼接多个供应商的 STT、LLM 和 TTS 服务,每接入一家服务商意味着一套独立的 API 文档、鉴权、计费和错误处理逻辑

50%
待验证

不同 TTS 引擎在自然度、延迟、语种覆盖上各有优劣,不同 STT 引擎在噪声环境、口音识别上表现不一

50%
待验证

一个能打电话的AI Agent通常由语音识别(STT)、对话大脑(LLM)、语音合成(TTS)三层能力组成

50%
待验证

该项目通过前置STT和后置TTS的精细优化,实现了大约0.3秒左右的响应延迟

50%
待验证

三明治架构的核心思路是把大语言推理模型(LLM)夹在中间,前面加STT模型负责语音识别,后面加TTS模型负责语音播报

50%

来源文章