港科大 M-A-P 团队:开源音乐模型的华人力量图鉴
【免费下载链接】YuE2-3B项目地址: https://ai.gitcode.com/hf_mirrors/m-a-p/YuE2-3B
当 Suno 凭闭源模型在 2025 年席卷全网时,很少有人注意到,在音乐生成这条赛道上,一支以香港科技大学为核心、横跨中美多所高校的华人团队,正在用一套"论文 + 开源权重 + 公开榜单"的组合拳,把全曲音乐生成的门槛一步步打下来。这支团队就是 M-A-P(Multimodal Art Projection,多模态艺术投影)。本文基于仓库源码与社区情报,梳理 M-A-P 的学术谱系、YuE 系列的技术路线,以及开源生态下华人团队正在改写音乐生成版图的真实路径。
M-A-P:把"多模态艺术"投影进开源世界
M-A-P 并非一家公司,而是一个以港科大为核心节点的研究型团队。从 README.md 中引用的论文作者列表可以看到清晰的学术版图:YuE2 论文由 Yuan Ruibin 领衔,通讯与合作者覆盖港科大(Xue Wei、Xia Gus、Guo Yike)以及耶鲁(LeCun Yann)等机构;YuE1 论文作者更是横跨港科大、复旦、CMU、滑铁卢等十余家单位。这是一条典型的"学术界主导、开源分发"的路线——与闭源商业公司形成鲜明对照。
团队的名字"多模态艺术投影"直接点明了研究主旨:让机器在音乐、语音等多模态艺术形式间建立可解释的映射。早在 YuE 之前,M-A-P 便以 MERT(音乐表征 Transformer)系列闻名——本仓库的 Hugging Face 生态页面上仍挂着 MERT-v2-30s 与 MERT-v2-FullSong 两个配套模型。从自监督音乐表征学习切入,再到全曲生成,这条演进路径显示出清晰的学术积累,而非单纯的工程追赶。
从 YuE 到 YuE2:一条清晰的学术开源路线
社区情报最早在 2025 年 2 月捕捉到 YuE 的身影:港科大与 M-A-P 团队联合发布的开源模型,能把歌词转化为带人声的完整歌曲,支持多语言多风格。彼时它已是开源阵营里少数能"端到端生成整首歌"的存在。而本仓库里的 YuE2-3B,则是这条路线上的第二代跃迁——README 的第一句话就给出了野心:README.md 声称其歌曲质量"与 Suno v5/v6 处于同一前沿水平"。
更重要的是,YuE2 把上一代"歌词→音频"的黑盒流程,拆成了可编辑、可解释的流水线:先由符号规划模块写出 ABC 乐谱(旋律与和弦),再生成语义 token,最后通过流匹配合成声学特征。配套的 SheetSage2 模型(README 中列为独立引用)负责把现有录音转写成乐谱,从而支撑翻唱与"乐谱编辑"场景。社区对 YuE 的诸多实操帖——从两阶段生成、LoRA 微调、歌词结构规范到 24GB 显存部署——恰好验证了这条路线在真实用户手中的可用性。
源码级拆解:YuE2 的"符号规划 + 流匹配"双引擎
打开 config.json,YuE2-3B 的骨架一目了然:28 层 Transformer、hidden size 2048、16 个注意力头、8 个 KV 头、词表 184704、上下文窗口 24576,BF16 精度,权重约 7.3GB(见 weights_manifest.json)。与上一代 YuE 不同,YuE2 只有 3B 规模,却通过架构创新换来了更强的效果与更低的资源门槛。
真正的技术核心在 modeling_yue2.py。这份自定义代码实现了三个关键设计:
- Mixture-of-Transformers(MoT)双路径:每个 DecoderLayer 内同时存在 AR(自回归)与 NAR(非自回归)两套注意力投影和两套 MLP,通过
ar_mask逐位置路由。AR 路径负责生成乐谱与语义 token,NAR 路径负责并行重建声学信息,二者共享同一份 KV 缓存——这正是"写谱 + 合成"双任务的物理载体。 - 符号规划(symbolic planning):生成流程被明确拆成
pipe.plan()→generate_semantic()→synthesize()→decode()四个阶段(README 的 Quick Start 部分)。其中cot="full"表示"旋律 + 和弦规划",cot="melody"只规划旋律(适合翻唱),cot="off"则退化为纯端到端生成。 - 流匹配声学解码:
nar_velocity方法实现了 flow-matching 的速度场预测,配合 yue2_generation_config.json 中 32 步 midpoint ODE 求解器,将 latent 去噪为可听音频。所有声学帧先被 VAE 编码为 64 维 latent,再由llm2vae/vae2llm两个线性桥接层与文本侧对齐——这是"可编辑乐谱 + 高质量音频"能够成立的关键。
社区里流传的"两阶段架构"说法,在源码层面可以精确对应为"AR 阶段写谱、NAR 阶段合成、流匹配阶段解码"的三段式工程链路。README 还公开了性能基准:RTX 4090 上生成一首 3.6 分钟的歌曲仅需约 71 秒,峰值显存 11.18 GiB;H800 服务端在并发 32 时可达每秒 3231 个系统 token、每小时 373 首歌曲的吞吐。
一张榜单看懂开源与闭源的分水岭
YuE2 最有说服力的论据,是 README 中公开的 WildSongBench 全量对比数据。在 192 条提示词的盲测协议下:
- YuE2(best-of-8)SongBench 平均分 6.9632,位列所有被评测模型(含闭源)第一,超过 Suno v5 的 6.8721、Suno v6 的 6.5562、Suno v6 Wild 的 6.4195,也超过同为华人背景的 MiniMax Music 2.6(6.3222)与 Mureka 9(6.9377);
- 音乐性维度 6.2666,同样领先 Suno v5 的 5.9918;MuLan 语义对齐 0.5068、Q3O 提示词遵循 4.7009 均居前列;
- 与自家上一代对比,YuE1 在 WildSongBench 上 SongBench 平均仅 4.9165——YuE2 把分数抬高了近 2 分,堪称质变;
- 在 SHS100K 零样本翻唱基准上,YuE2(full score)的 CLEWS mAP 达到 0.647、Hit@1 71.3%,显著高于此前的 SongEcho(0.419 / 48.4%),证明"乐谱条件"路线对歌曲身份保持有真实增益。
这份榜单的价值在于:它是团队自建数据集、自定协议、并与闭源商业模型同场竞技的公开结果,所有原始指标与 CSV 均随 WildSongBench 数据集发布。开源模型的每次进步,都以可复现的数字沉淀在生态里——这是闭源厂商无法提供的透明度。README 还挂出了"盲听竞技场"(Music Arena),邀请用户匿名对比 YuE2 与商业模型并投票,把客观评测与主观听感两条证据链同时打通。
华人团队开源路线的启示与想象空间
把视角拉远,2025-2026 年的音乐生成赛道正在形成两条泾渭分明的路径:一边是 Suno、谷歌 Lyria 等闭源巨头,靠 API 与订阅构建护城河;另一边是 ACE-Step、MiniMax、Mureka 与 YuE 系列构成的开源/准开源阵营——其中 MiniMax、Mureka、ACE 的创始团队均为华人背景,社区情报也记录了"ACE 完成 4000 万美元融资,成为 AI 音乐赛道融资额最高的华人团队"这类标志性事件。华人团队在音乐生成这一垂直赛道的密度,已经形成了事实上的"第二力量"。
YuE2 的选择则更具标本意义:权重以 CC BY-NC 4.0 发布(见 LICENSE),代码侧则对 stable-audio-tools、SnakeBeta 等第三方组件完整保留 MIT 许可并附 THIRD_PARTY_NOTICES.md,同时提供开箱即用的推理 wheel(yue2_infer-0.1.5-py3-none-any.whl)。这套"研究可用、工程可装、榜单可查"的组合,让社区能够在 24GB 显卡上本地跑通全流程——从 CSDN 上大量本地部署、参数调优、LoRA 微调、乃至游戏配乐与在线教育场景的实践帖可以看出,这种可复现性正在转化为真实的生产力。
当然,客观看待局限同样重要:CC BY-NC 4.0 意味着商用场景仍需单独授权,社区部分教程宣称的"无版权风险"并不准确;3B 规模虽然在 24GB 显存上流畅运行,但长歌生成与中文咬字仍有工程调优空间。此外,M-A-P 属于学术团队,持续投入依赖科研资助,与背靠大厂的 ACE、MiniMax 相比,其迭代节奏和算力储备存在天然差距——这也恰恰说明,华人团队在开源音乐这条路上,需要的不是单一英雄,而是学术、创业公司与社区三方合力的生态。
结语
从 MERT 的表征研究,到 YuE 的开山之作,再到 YuE2 用 3B 参数登顶开放榜单——M-A-P 与港科大用三年时间,把一个"华人团队能不能做出世界级开源音乐模型"的问题,变成了一个已经被数据回答的问题。而 YuE2 最大的贡献或许不在模型本身,而在于它示范了一种范式:当闭源厂商用 API 围墙圈住创作时,开源团队用可编辑的乐谱、可复现的榜单和可本地运行的权重,把音乐生成的控制权重新交还给了创作者。音乐生成的下一幕,大概率仍会由这股华人开源力量写下浓重一笔。
【免费下载链接】YuE2-3B项目地址: https://ai.gitcode.com/hf_mirrors/m-a-p/YuE2-3B
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考