[KongchangAI]
ModelVALL-E

VALL-E

微软于2023年发布的零样本语音合成模型,仅需3秒参考音频即可克隆目标人物声音

Core Facts

Timeline (last 90 days)

Sep 11

微软VALL-E将语音合成重新定义为语言建模问题,把语音编码为离散声学标记并像大语言模型预测下一个词一样预测下一个声学标记

Unverified50%
Sep 5

微软的VALL-E将TTS问题重新定义为语言建模问题,使用离散音频编码进行自回归预测

Unverified50%
Sep 4

基于Transformer架构的TTS模型如VALL-E、Bark仅需数秒真人语音样本即可克隆出高度相似的合成音频

Unverified50%
Aug 30

微软的VALL-E及开源项目Bark和RVC等语音克隆技术能仅凭数秒语音样本生成高度逼真的仿声音频

Unverified60%
Aug 10

Codec-based方案(如VALL-E、SoundStorm)将语音编码为离散token,然后用语言模型方式生成,实现更好的零样本语音克隆效果

Unverified60%
Jul 23

微软 2023 年发布的 VALL-E 将语音生成建模为语言模型问题,仅需 3 秒参考音频即可实现零样本克隆,采用 EnCodec 神经音频编解码器

Unverified60%

All Facts (10)

Source Articles