[控场AI]
模型YuE2 / Yue2

YuE2

开源音乐生成模型YuE系列的迭代版本,专注于根据文本提示或歌词生成带有人声演唱和伴奏的完整音乐片段,支持歌词到人声的映射

时间轴 (近 90 天)

9月15日

测试者预计ComfyUI官方很可能在几天内加入对YuE2的正式支持

待验证50%
9月15日

YuE2对某些音乐流派的知识较为有限,但在擅长领域效果出色

待验证50%
9月15日

测试者表示YuE2在翻唱(cover)场景下表现几乎和Suno一样好,且没有任何内容过滤器

待验证50%
9月15日

测试者认为在当前所有可用的本地音乐模型中YuE2是最出色的一个

待验证50%
9月15日

INT8量化的CONVROT版本YuE2模型显存占用约为8GB,可运行在RTX 4070 12GB这样的消费级显卡上

待验证50%
9月15日

使用YuE2生成一首四分钟长度的歌曲耗时约120到150秒

待验证50%
9月15日

CONVROT是YuE2针对音乐生成任务做了结构调整的一种特定架构变体

待验证50%
9月15日

测试者认为YuE2在纯文本生成歌曲能力上仍达不到旧版Suno(如已退役的Suno 5.5及更早版本)的水准

待验证50%
9月15日

开发者 filliptm 与 MachineDelusions 合作为 ComfyUI 开发了一套 YuE2 LoRA 训练器

待验证50%
9月15日

YuE2 LoRA 训练器允许用户在 ComfyUI 的可视化节点环境中直接对 YuE2 音乐生成模型进行 LoRA 微调训练

待验证50%

还有 13 条时间轴事件

全部知识事实 (20)

待验证

测试者认为在当前所有可用的本地音乐模型中YuE2是最出色的一个

50%
待验证

YuE2对某些音乐流派的知识较为有限,但在擅长领域效果出色

50%
待验证

测试者表示YuE2在翻唱(cover)场景下表现几乎和Suno一样好,且没有任何内容过滤器

50%
待验证

INT8量化的CONVROT版本YuE2模型显存占用约为8GB,可运行在RTX 4070 12GB这样的消费级显卡上

50%
待验证

使用YuE2生成一首四分钟长度的歌曲耗时约120到150秒

50%
待验证

CONVROT是YuE2针对音乐生成任务做了结构调整的一种特定架构变体

50%
待验证

测试者认为YuE2在纯文本生成歌曲能力上仍达不到旧版Suno(如已退役的Suno 5.5及更早版本)的水准

50%
待验证

YuE2 LoRA 训练器允许用户在 ComfyUI 的可视化节点环境中直接对 YuE2 音乐生成模型进行 LoRA 微调训练

50%
待验证

该训练器是围绕作者研究中开发的编码器和分词器脚本专门构建的,而非通用型工具的移植

50%
待验证

开发者用 YuE2 跨越多种音乐流派生成了数千首歌曲以形成音频—标记配对数据

50%
待验证

该方案使用 YuE2 自己的解码器对编码器进行自监督验证:若编码器为真实音频产出的标记经解码器重建能还原原始音频,则说明标记正确

50%
待验证

缺少编码器意味着用户无法将自己的音乐输入 YuE2 模型进行微调

50%
待验证

YuE2 生成的每一首歌都自带产生它的精确标记,因此每次生成都是天然的带标签样本

50%
待验证

YuE2 的底层工作机制是先生成语义标记(semantic tokens),再将标记转换成实际音频

50%
待验证

YuE2 官方从未公开发布将已有录音转换成语义标记的编码器

50%
待验证

YuE2-3B 是一款开源音乐生成模型

50%
待验证

ComfyUI-Olm-YuE2 是由开发者 o-l-l-i 打造的自定义节点集,将 YuE2 音乐生成模型集成进 ComfyUI 工作流

50%
待验证

项目本身不包含模型权重,用户需自行下载 YuE2 相关文件并放置到指定位置

50%
待验证

YuE 是一个开源音乐生成模型系列,能根据文本提示或歌词生成带有人声演唱和伴奏的完整音乐片段

50%
待验证

测试者预计ComfyUI官方很可能在几天内加入对YuE2的正式支持

50%

来源文章