[控场AI]
概念Text-to-Video with Audio / 文本生成带音频视频

T2VA

通过文本提示同时生成视频画面与配套音频(包括语音、音效、背景音乐)的多模态生成范式,相比单纯T2V需在时间轴上同步协调视觉与声音内容,口型同步是其核心技术挑战之一

时间轴 (近 90 天)

9月12日

H3 的 T2VA 是 Text-to-Video-Avatar(文本到视频角色)功能

待验证50%
9月12日

该创作者已将角色生成的默认工具从 Krea 2 切换到 H3 的 T2VA

待验证50%
9月12日

该创作者认为 H3 的 T2VA 画质优于 Krea 2

待验证50%
9月12日

该创作者的角色一致性工作流是:用 T2VA 生成人物静帧,生成1-2秒的动态角色表,再重建成可复用的 .chars 角色文件

待验证50%
9月11日

一位创作者使用H3模型通过T2VA工作流生成了80年代风格的角色视频

待验证50%

全部知识事实 (5)

来源文章