36亿参数开源模型YuE2-3B,从歌词到立体声歌曲的全流程AI音乐生成

m-a-p团队于2026年9月开源的YuE2-3B模型,是一款约36亿参数的整曲音乐生成工具。该模型支持通过输入歌词和风格描述,自动生成包含乐谱、人声和伴奏的48kHz立体声歌曲,并允许用户对生成的乐...

人工智能

在人工智能音乐生成领域,一个名为YuE2-3B的开源模型正在引发关注。这款由m-a-p团队于2026年9月发布的约36亿参数模型,将复杂的音乐创作过程简化为只需输入歌词和风格描述即可生成完整歌曲的交互方式。与传统的黑盒式AI音乐生成不同,YuE2-3B首先生成一份可编辑的乐谱,用户可以对其进行修改后再渲染成最终音频文件。

YuE2-3B的核心技术架构采用了混合Transformer模型,结合自回归(AR)和非自回归(NAR)两种生成模式。在生成过程中,模型首先通过语义token预测生成乐谱和歌词,然后利用流匹配(flow matching)生成声学潜在表示,最后通过变分自编码器(VAE)解码器生成48kHz立体声音频。这种分步生成的方式使得用户可以在创作过程中随时介入和调整。

值得注意的是,YuE2-3B的乐谱采用标准ABC记谱法,旋律和和弦都以显式文本形式呈现。例如,项目示例中的V: Vocal部分定义了人声旋律,而V: Ins部分则包含了伴奏信息。这种设计使得用户可以直接编辑乐谱中的音符或时值,而无需重新生成整个作品。官方实验数据显示,在10首作品上进行局部编辑后,旋律达成度从0.0083提升至0.9375,和声达成度从0提升至0.8313。

除了原创歌曲生成,YuE2-3B还支持歌曲翻唱功能。用户只需上传原始音频,系统会自动将其转换为乐谱,然后结合新的歌词和目标风格进行渲染。这一过程在AIGCPanel平台上实现了一键操作,用户无需手动拼接多个环境。官方评测显示,在948首作品上的翻唱任务中,当提供完整乐谱时,YuE2的CLEWS mAP达到0.647,Hit@1为71.3%。

文章配图

在性能对比方面,YuE2-3B在2026年9月12日的评测中表现出色。在SongBench Avg指标上,单次生成的YuE2得分为6.7316,最佳8次采样的平均得分为6.9632,均高于Suno v5/v6等闭源商业模型。尽管在AudioBox PQ和PER指标上略有差距,但这些差异未达到统计显著性。

YuE2-3B的本地化部署也颇具特色。通过AIGCPanel平台,用户可以轻松下载并运行该模型,支持Windows、macOS和Linux系统。根据显存需求,用户可以选择Q8_0(约12GB)或Q4_0(约8GB)两种精度版本,内存建议至少32GB以上。

在行业对比中,YuE2-3B的表现尤为突出。如图2所示,在Song quality index与Text alignment index的二维坐标系中,YuE2-3B位于右上方区域,显示出其在音乐质量和文本对齐方面的优势。与Suno v6、Mureka等模型相比,YuE2-3B在综合性能上具有明显竞争力。

YuE2-3B的开源特性使其成为音乐创作者和研究者的重要工具。通过提供可编辑的乐谱接口,该模型不仅降低了音乐创作的门槛,还为音乐教育和理论研究提供了新的可能性。随着更多开发者和用户的参与,YuE2-3B有望推动AI音乐生成技术的进一步发展。