Unverified70% confidenceFactTime unknown
Fish Speech底层采用了VITS架构的改进版本,将文本编码、韵律预测和声码器整合在一个端到端的框架中
1
Sources
70%
Confidence
Long-term
Relevance
6/1/2026
First Seen
Sources
Codex桌面宠物实战:从零打造会说话的AI小精灵
bilibili灵姐说AI
Related Entities
Related Claims
UnverifiedFish Audio是一款基于深度学习的文本转语音(TTS)服务,支持多种音色克隆和自然语音合成71% similarUnverifiedVITS将变分推断与对抗训练结合,实现从文本到波形的端到端训练,能在150ms以内生成高自然度语音70% similarUnverified现代神经 TTS 系统通常采用两阶段架构:先将文本转换为声学特征(如梅尔频谱),再通过声码器转换为波形音频66% similarUnverified现代TTS方案如VITS、ElevenLabs能生成高度自然的合成语音66% similarUnverified早期ChatGPT语音采用级联架构,先语音转文字、再由大语言模型生成回答、最后转成语音播出66% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/25995API
curl https://kongchang.com/api/v1/knowledge/claims/25995MCP
get_claim(id=25995)