ConceptText-to-Speech / 文本转语音
TTS
TTS(Text-To-Speech,文本转语音)是一种将书面文字自动转换为语音输出的语音合成技术。其核心能力包括:对文本进行语言分析与处理、通过语音合成引擎生成自然语音波形,并支持多语言、多音色输出。TTS广泛应用于无障碍辅助、智能助手、导航播报、教育软件等领域,是人机交互的重要基础技术之一。
Timeline (last 90 days)
Jun 3
TTS模型在处理较短文本时能更好地维持韵律一致性,长文本输入容易导致后段语音质量下降
Unverified85%
Jun 1
Pixelle-Video的流水线整合了大语言模型(LLM)、扩散模型、TTS语音合成和语音识别(ASR)等多种AI技术
Unverified70%
Jun 1
传统语音AI系统采用级联架构,将语音处理拆分为ASR、NLU、对话管理和TTS等独立模块,每个模块之间存在信息损失和延迟累积
Verified65%
Jun 1
当前主流的神经网络TTS方案包括Tacotron系列、FastSpeech系列以及VITS、Bark等端到端模型
Unverified85%
Jun 1
OpenAI的TTS API提供了alloy、echo、fable、onyx、nova、shimmer六种预设音色,支持实时流式输出
Unverified95%
Jun 1
本地TTS模型实时渲染克隆声线时会导致电脑卡死,因为声音克隆推理需要额外占用数百MB到数GB的显存
Unverified75%
Jun 1
解决实时渲染卡死问题的方案是放弃实时生成,改为预生成固定语音文件,运行时直接调用
Unverified90%
Jun 1
传统语音交互的三段式架构(ASR+LLM+TTS)总延迟通常在1-3秒
Unverified65%
Jun 1
Google AI Studio提供Gemini 3.1 Flash TTS Preview文本转语音模型,支持多角色对话、丰富音色库和情感标注功能
Unverified80%
Jun 1
Google 推出了 Gemini Flash TTS(低延迟优化)和 Gemini Pro TTS(质量优化)两个语音合成模型
Unverified80%
40 more timeline events
All Facts (1)
Source Articles
Qwen3 Max实测、Seed Audio 1.0与Matrix-3.5:国产AI三连发深度解析Jul 23语音AI Agent架构选型:Pipecat Flows vs Vapi Squad深度对比Jul 23Voicebox:GitHub爆火的开源AI语音工作室全解析Jul 22零代码用Claude Code构建商业级AI语音助手:5大实战场景拆解Jul 22Opal:设计师用OpenClaw在树莓派上打造AI宠物助手Jul 21Claude Opus 5即将发布,阿里千问正式接入苹果智能Jul 21AIRI:开源自托管AI伴侣,打造你的赛博Neuro-samaJul 20GPT-Live实时语音交互:边听边说如何实现自然对话Jul 20