模型
Wav2Lip
专用的音频驱动口型同步深度学习模型,能够根据音频信号驱动视频中人物的口型运动,常用于数字人和视频后期处理场景
时间轴 (近 90 天)
10月1日
Wav2Lip、SadTalker 等专门针对唇形同步优化的模型大幅提升了自然度和稳定性
待验证50%
9月16日
对口型(lip-sync)需要额外的驱动网络(如SadTalker、Wav2Lip)将音频波形与人脸关键点动画对齐,比单纯语音合成复杂
待验证50%
9月4日
Wav2Lip模型在LRS2基准测试上实现了接近真实视频的唇形同步评分
待验证50%
8月23日
传统口型同步算法Wav2Lip的工作原理是检测人脸关键点,然后在嘴部区域替换为与音频匹配的口型
待验证50%
8月23日
Wav2Lip等传统口型算法在头部大角度转动或面部被遮挡时会失效,因为依赖对正脸的稳定关键点检测
待验证50%