[KongchangAI]
ConceptSpeech-to-Text / 语音转文本

STT

语音转文字(Speech-to-Text,STT),又称自动语音识别(ASR),是一种将人类口语音频信号自动转换为可读文本的技术。其核心依赖声学模型、语言模型和解码算法,能够识别连续自然语音、多语言及不同口音。广泛应用于语音助手、实时字幕、语音输入、电话客服分析等场景,是人机交互领域的基础技术之一。

Core Facts

Timeline (last 90 days)

Sep 17

低延迟和高识别率涉及语音活动检测(VAD)和语音转文字(STT)引擎的选型

Unverified50%
Sep 17

在音频进入STT前加入降噪、去混响、音量归一化和VAD等预处理可显著提升下游转录质量

Unverified50%
Sep 17

STT模型在低信噪比场景下不会承认听不清,而是倾向于编造合理但错误的词句(产生幻觉)

Unverified50%
Sep 11

ODS 集成了语音交互能力,支持语音转文本(STT)和文本转语音(TTS)

Unverified60%
Sep 11

构建语音产品时开发者通常需要拼接多个供应商的 STT、LLM 和 TTS 服务,每接入一家服务商意味着一套独立的 API 文档、鉴权、计费和错误处理逻辑

Unverified50%
Sep 11

不同 TTS 引擎在自然度、延迟、语种覆盖上各有优劣,不同 STT 引擎在噪声环境、口音识别上表现不一

Unverified50%
Sep 11

一个能打电话的AI Agent通常由语音识别(STT)、对话大脑(LLM)、语音合成(TTS)三层能力组成

Unverified50%
Aug 31

该项目通过前置STT和后置TTS的精细优化,实现了大约0.3秒左右的响应延迟

Unverified50%
Aug 31

三明治架构的核心思路是把大语言推理模型(LLM)夹在中间,前面加STT模型负责语音识别,后面加TTS模型负责语音播报

Unverified50%
Aug 4

End-to-end latency in voice AI typically involves three stages: speech-to-text (STT) recognition, large language model inference, and text-to-speech (TTS) synthesis

Unverified60%

3 more timeline events

All Facts (13)

Verified

传统语音AI普遍采用级联式架构,先用ASR将语音转文字,再交给语言模型处理,最后用TTS合成输出

75%
Verified

一次完整的语音AI交互涉及STT、LLM推理、TTS三个串行处理阶段

65%
Verified

早期ChatGPT语音采用级联架构,先语音转文字、再由大语言模型生成回答、最后转成语音播出

65%
Unverified

ODS 集成了语音交互能力,支持语音转文本(STT)和文本转语音(TTS)

60%
Unverified

End-to-end latency in voice AI typically involves three stages: speech-to-text (STT) recognition, large language model inference, and text-to-speech (TTS) synthesis

60%
Unverified

低延迟和高识别率涉及语音活动检测(VAD)和语音转文字(STT)引擎的选型

50%
Unverified

在音频进入STT前加入降噪、去混响、音量归一化和VAD等预处理可显著提升下游转录质量

50%
Unverified

STT模型在低信噪比场景下不会承认听不清,而是倾向于编造合理但错误的词句(产生幻觉)

50%
Unverified

构建语音产品时开发者通常需要拼接多个供应商的 STT、LLM 和 TTS 服务,每接入一家服务商意味着一套独立的 API 文档、鉴权、计费和错误处理逻辑

50%
Unverified

不同 TTS 引擎在自然度、延迟、语种覆盖上各有优劣,不同 STT 引擎在噪声环境、口音识别上表现不一

50%
Unverified

一个能打电话的AI Agent通常由语音识别(STT)、对话大脑(LLM)、语音合成(TTS)三层能力组成

50%
Unverified

该项目通过前置STT和后置TTS的精细优化,实现了大约0.3秒左右的响应延迟

50%
Unverified

三明治架构的核心思路是把大语言推理模型(LLM)夹在中间,前面加STT模型负责语音识别,后面加TTS模型负责语音播报

50%

Source Articles