news 2026/10/11 13:10:57

港科大 M-A-P 团队:开源音乐模型的华人力量图鉴

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
港科大 M-A-P 团队:开源音乐模型的华人力量图鉴

港科大 M-A-P 团队:开源音乐模型的华人力量图鉴

【免费下载链接】YuE2-3B项目地址: https://ai.gitcode.com/hf_mirrors/m-a-p/YuE2-3B

当 Suno 凭闭源模型在 2025 年席卷全网时,很少有人注意到,在音乐生成这条赛道上,一支以香港科技大学为核心、横跨中美多所高校的华人团队,正在用一套"论文 + 开源权重 + 公开榜单"的组合拳,把全曲音乐生成的门槛一步步打下来。这支团队就是 M-A-P(Multimodal Art Projection,多模态艺术投影)。本文基于仓库源码与社区情报,梳理 M-A-P 的学术谱系、YuE 系列的技术路线,以及开源生态下华人团队正在改写音乐生成版图的真实路径。

M-A-P:把"多模态艺术"投影进开源世界

M-A-P 并非一家公司,而是一个以港科大为核心节点的研究型团队。从 README.md 中引用的论文作者列表可以看到清晰的学术版图:YuE2 论文由 Yuan Ruibin 领衔,通讯与合作者覆盖港科大(Xue Wei、Xia Gus、Guo Yike)以及耶鲁(LeCun Yann)等机构;YuE1 论文作者更是横跨港科大、复旦、CMU、滑铁卢等十余家单位。这是一条典型的"学术界主导、开源分发"的路线——与闭源商业公司形成鲜明对照。

团队的名字"多模态艺术投影"直接点明了研究主旨:让机器在音乐、语音等多模态艺术形式间建立可解释的映射。早在 YuE 之前,M-A-P 便以 MERT(音乐表征 Transformer)系列闻名——本仓库的 Hugging Face 生态页面上仍挂着 MERT-v2-30s 与 MERT-v2-FullSong 两个配套模型。从自监督音乐表征学习切入,再到全曲生成,这条演进路径显示出清晰的学术积累,而非单纯的工程追赶。

从 YuE 到 YuE2:一条清晰的学术开源路线

社区情报最早在 2025 年 2 月捕捉到 YuE 的身影:港科大与 M-A-P 团队联合发布的开源模型,能把歌词转化为带人声的完整歌曲,支持多语言多风格。彼时它已是开源阵营里少数能"端到端生成整首歌"的存在。而本仓库里的 YuE2-3B,则是这条路线上的第二代跃迁——README 的第一句话就给出了野心:README.md 声称其歌曲质量"与 Suno v5/v6 处于同一前沿水平"。

更重要的是,YuE2 把上一代"歌词→音频"的黑盒流程,拆成了可编辑、可解释的流水线:先由符号规划模块写出 ABC 乐谱(旋律与和弦),再生成语义 token,最后通过流匹配合成声学特征。配套的 SheetSage2 模型(README 中列为独立引用)负责把现有录音转写成乐谱,从而支撑翻唱与"乐谱编辑"场景。社区对 YuE 的诸多实操帖——从两阶段生成、LoRA 微调、歌词结构规范到 24GB 显存部署——恰好验证了这条路线在真实用户手中的可用性。

源码级拆解:YuE2 的"符号规划 + 流匹配"双引擎

打开 config.json,YuE2-3B 的骨架一目了然:28 层 Transformer、hidden size 2048、16 个注意力头、8 个 KV 头、词表 184704、上下文窗口 24576,BF16 精度,权重约 7.3GB(见 weights_manifest.json)。与上一代 YuE 不同,YuE2 只有 3B 规模,却通过架构创新换来了更强的效果与更低的资源门槛。

真正的技术核心在 modeling_yue2.py。这份自定义代码实现了三个关键设计:

  • Mixture-of-Transformers(MoT)双路径:每个 DecoderLayer 内同时存在 AR(自回归)与 NAR(非自回归)两套注意力投影和两套 MLP,通过ar_mask逐位置路由。AR 路径负责生成乐谱与语义 token,NAR 路径负责并行重建声学信息,二者共享同一份 KV 缓存——这正是"写谱 + 合成"双任务的物理载体。
  • 符号规划(symbolic planning):生成流程被明确拆成pipe.plan()→generate_semantic()→synthesize()→decode()四个阶段(README 的 Quick Start 部分)。其中cot="full"表示"旋律 + 和弦规划",cot="melody"只规划旋律(适合翻唱),cot="off"则退化为纯端到端生成。
  • 流匹配声学解码:nar_velocity方法实现了 flow-matching 的速度场预测,配合 yue2_generation_config.json 中 32 步 midpoint ODE 求解器,将 latent 去噪为可听音频。所有声学帧先被 VAE 编码为 64 维 latent,再由llm2vae/vae2llm两个线性桥接层与文本侧对齐——这是"可编辑乐谱 + 高质量音频"能够成立的关键。

社区里流传的"两阶段架构"说法,在源码层面可以精确对应为"AR 阶段写谱、NAR 阶段合成、流匹配阶段解码"的三段式工程链路。README 还公开了性能基准:RTX 4090 上生成一首 3.6 分钟的歌曲仅需约 71 秒,峰值显存 11.18 GiB;H800 服务端在并发 32 时可达每秒 3231 个系统 token、每小时 373 首歌曲的吞吐。

一张榜单看懂开源与闭源的分水岭

YuE2 最有说服力的论据,是 README 中公开的 WildSongBench 全量对比数据。在 192 条提示词的盲测协议下:

  • YuE2(best-of-8)SongBench 平均分 6.9632,位列所有被评测模型(含闭源)第一,超过 Suno v5 的 6.8721、Suno v6 的 6.5562、Suno v6 Wild 的 6.4195,也超过同为华人背景的 MiniMax Music 2.6(6.3222)与 Mureka 9(6.9377);
  • 音乐性维度 6.2666,同样领先 Suno v5 的 5.9918;MuLan 语义对齐 0.5068、Q3O 提示词遵循 4.7009 均居前列;
  • 与自家上一代对比,YuE1 在 WildSongBench 上 SongBench 平均仅 4.9165——YuE2 把分数抬高了近 2 分,堪称质变;
  • 在 SHS100K 零样本翻唱基准上,YuE2(full score)的 CLEWS mAP 达到 0.647、Hit@1 71.3%,显著高于此前的 SongEcho(0.419 / 48.4%),证明"乐谱条件"路线对歌曲身份保持有真实增益。

这份榜单的价值在于:它是团队自建数据集、自定协议、并与闭源商业模型同场竞技的公开结果,所有原始指标与 CSV 均随 WildSongBench 数据集发布。开源模型的每次进步,都以可复现的数字沉淀在生态里——这是闭源厂商无法提供的透明度。README 还挂出了"盲听竞技场"(Music Arena),邀请用户匿名对比 YuE2 与商业模型并投票,把客观评测与主观听感两条证据链同时打通。

华人团队开源路线的启示与想象空间

把视角拉远,2025-2026 年的音乐生成赛道正在形成两条泾渭分明的路径:一边是 Suno、谷歌 Lyria 等闭源巨头,靠 API 与订阅构建护城河;另一边是 ACE-Step、MiniMax、Mureka 与 YuE 系列构成的开源/准开源阵营——其中 MiniMax、Mureka、ACE 的创始团队均为华人背景,社区情报也记录了"ACE 完成 4000 万美元融资,成为 AI 音乐赛道融资额最高的华人团队"这类标志性事件。华人团队在音乐生成这一垂直赛道的密度,已经形成了事实上的"第二力量"。

YuE2 的选择则更具标本意义:权重以 CC BY-NC 4.0 发布(见 LICENSE),代码侧则对 stable-audio-tools、SnakeBeta 等第三方组件完整保留 MIT 许可并附 THIRD_PARTY_NOTICES.md,同时提供开箱即用的推理 wheel(yue2_infer-0.1.5-py3-none-any.whl)。这套"研究可用、工程可装、榜单可查"的组合,让社区能够在 24GB 显卡上本地跑通全流程——从 CSDN 上大量本地部署、参数调优、LoRA 微调、乃至游戏配乐与在线教育场景的实践帖可以看出,这种可复现性正在转化为真实的生产力。

当然,客观看待局限同样重要:CC BY-NC 4.0 意味着商用场景仍需单独授权,社区部分教程宣称的"无版权风险"并不准确;3B 规模虽然在 24GB 显存上流畅运行,但长歌生成与中文咬字仍有工程调优空间。此外,M-A-P 属于学术团队,持续投入依赖科研资助,与背靠大厂的 ACE、MiniMax 相比,其迭代节奏和算力储备存在天然差距——这也恰恰说明,华人团队在开源音乐这条路上,需要的不是单一英雄,而是学术、创业公司与社区三方合力的生态。

结语

从 MERT 的表征研究,到 YuE 的开山之作,再到 YuE2 用 3B 参数登顶开放榜单——M-A-P 与港科大用三年时间,把一个"华人团队能不能做出世界级开源音乐模型"的问题,变成了一个已经被数据回答的问题。而 YuE2 最大的贡献或许不在模型本身,而在于它示范了一种范式:当闭源厂商用 API 围墙圈住创作时,开源团队用可编辑的乐谱、可复现的榜单和可本地运行的权重,把音乐生成的控制权重新交还给了创作者。音乐生成的下一幕,大概率仍会由这股华人开源力量写下浓重一笔。

【免费下载链接】YuE2-3B项目地址: https://ai.gitcode.com/hf_mirrors/m-a-p/YuE2-3B

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/10/11 13:06:06

运动想象脑电分类:CNN与Transformer混合架构实战解析

简介:这是一份基于Transformer的运动想象脑电信号分类Python源码,整合CNN与局部时空特征提取,对应个人毕设项目(答辩98分),适合计算机、人工智能、自动化等专业学生用于课程设计、大作业或毕业设计。资源包…

作者头像 李华
网站建设 2026/10/11 13:05:58

Python+OpenCV人脸识别大作业:从环境搭建到LBPH识别全流程

简介:这是一套面向高校学生与Python初学者的计算机视觉实践项目源码,以人脸识别为核心功能,适合用作期末大作业、课程设计或自学练手。项目基于Python与OpenCV实现,涵盖人脸检测、特征提取与识别等典型流程,代码经过严…

作者头像 李华
网站建设 2026/10/11 13:05:58

5000左右游戏笔记本怎么选?用TaoToken统一Key跑通配置验证

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华
网站建设 2026/10/11 13:05:42

CNN调制识别实战:把IQ数据当作图像分类的完整指南

简介:面向通信信号调制识别任务的Python实现与项目详解,可作为深度学习方法应用于通信信号处理的教学案例、算法基准或毕业设计参考。项目将信号映射为二维星座图,利用卷积神经网络自动区分MPSK/MQAM等多种调制格式,涵盖数据生成、…

作者头像 李华