近期,香港科技大学联合M-A-P、NOIZ AI、斯坦福等机构发布并开源了一个统一符号与音频音乐生成的模型YuE2,将开源音乐生成的质量推向与前沿闭源模型正面竞争的位置。
在WildSongBench的192个prompts评测中,YuE2已逼近Suno v5、Mureka 9,同时超过Suno最新一代闭源模型v6及v6 Wild;八选一后更以6.9632拿下17组参评系统最高分,遥遥领先多款前沿闭源模型。


但YuE2的野心远不止把开源音乐生成推到frontier水平。它还试图解决AI音乐创作长期存在的另一个难题:如何让一次性的生成结果,变成一个可以被理解、定位、修改,并持续迭代的创作过程。
如果说过去用户更多是在一次次“抽卡”中寻找满意的结果;那么YuE2希望把一首生成出来的歌,真正变成可以继续打磨的作品。
采用WildSongBench进行评测,在192个prompts上,YuE2的SongBench平均分达到6.7316,逼近Suno v5的6.8721和Mureka 9的6.9377;同时超过Suno最新一代模型v6(6.5562)及v6 Wild(6.4195)。在八选一设置下,YuE2得分进一步提升至6.9632,超过包括Suno v5、v6、MiniMax Music 2.6、Mureka 9在内的多款前沿闭源音乐模型。

不只是生成一首歌,YuE2把音乐变成一份可以继续被修改的“工程文件”。在生成音频之前,模型会先规划一份包含人声旋律、器乐旋律、和弦和段落结构的双轨曲稿,并以ABC文本记谱形式保存。这种“先写下作曲安排,再生成最终声音”的方式,就是YuE2引入的核心机制创新——symbolic planning(乐谱规划)。音频中的旋律和和声不再是黑盒结果,而是能够被创作者定位、修改,再重新演绎。
这也使得YuE2能够支持Agentic Music Editing。比如,用户可以直接说:“保留副歌的人声旋律,但插入一段《小星星》萨克斯solo,和声变得更现代一些。”接入YuE2的Agent可以读取原曲的旋律与和弦,结合乐理提出修改方案,定位并改写对应的和弦或音符,再调用YuE2生成新的完整版本。用户不需要自己理解乐谱,也可以通过自然语言持续调整已有的歌曲。
对于专业音乐人,同一套机制则提供更直接的控制。例如,一首副歌原本采用4–5–3–6–2–5–1的和声进行,音乐人可以保留原有Vocal与Ins两条旋律,只将其中一个和弦修改为减七和弦,再让YuE2重新演绎。改动进入声音的同时,没有修改的旋律与和声可以被尽量保留。
实验也验证了这种编辑能力。研究者对完整作品中的旋律与和弦进行定向修改后,目标音高匹配率由0.83%提升至93.75%,目标和弦一致率由0提升至83.13%;未修改部分的旋律和和弦相似度分别保持在0.96和0.93以上。重新生成整曲时,改动能够进入声音,其他部分的主要旋律与和弦内容也能得到较好保留。
YuE2的symbolic planning创新,使歌曲先以可读、可编辑的曲稿表示,再由模型将修改后的作曲安排重新演绎为完整音频,从而把过去偏“黑盒”的音乐生成,变成可以定位、修改、验证并持续迭代的创作过程。
一首已经完成的歌,也可以成为下一轮创作的起点。与直接基于音频模仿的翻唱方式不同,YuE2首先理解歌曲中的旋律、和声和结构,再重新组织声音表达。借助SheetSage2,已有录音被还原成包含旋律、和弦、节拍等信息的可编辑曲稿,再基于这份曲稿重新生成新的演绎版本。

这意味着,创作者可以保留原曲最有辨识度的人声主题或旋律框架,同时按照创作意愿重新安排器乐、和声、唱法和整体风格。比如,同一段旋律可以从原本的编配切换成另一种曲风,也可以保留主旋律,只重做伴奏和演唱方式。Cover不再只是“照着原曲再唱一遍”,而是可以在保留作品核心辨识度的同时,做新的编排和再创作。
团队在948首作品上进行了零样本Cover Song评测,每种方法共生成3792个结果,且不进行候选筛选,YuE2也没有针对翻唱任务进行专项微调。在完整曲谱条件下,生成结果在CLEWS检索系统中的首位命中率达到71.3%;去掉曲谱后仅为0.3%。在两套检索系统的八项指标中,完整曲谱条件下的YuE2均高于SongEcho和ACE-Step 1.5。
更关键的是,Cover Song和前面的编辑能力并不是两套割裂的流程。已有歌曲被转成曲稿后,创作者还可以继续修改旋律、和弦或编配,再交给YuE2重新演绎。从翻唱到改编,再到生成新的版本,可以发生在同一套创作流程里。音乐不再是一次生成、一次抽卡的结果,而是一首可以被创作者持续修改和打磨的作品。
为了让一首歌既能被理解和修改,又能最终生成完整音频,YuE2同时开源了MERT2、SheetSage2以及配套的tokenizer/codec。
MERT2是整个系统底层的音乐理解模型。它把连续音频编码到一个有结构的向量空间中,让旋律、和弦、节奏等具有相似音乐属性的内容在表示空间里彼此更接近,为后续的音乐理解、检索和生成提供基础。在MARBLE的10项任务、15个指标中,MERT2系列有14项领先报告中的对照模型;基于MERT2构建的低码率音乐token,在与MuCodec和EnCodec的六项对比指标中也有五项取得最高分。
在MERT2的基础上进一步微调得到的SheetSage2,则负责把已有录音还原成旋律、和弦、节拍和结构等可编辑的曲稿信息,为Cover Song和后续编辑提供入口。在技术报告列出的13组转谱评测中,SheetSage2有10组取得最高分,覆盖旋律、和弦、调性、节拍与结构等任务。
这些能力最终汇入YuE2约36亿参数的Mixture-of-Transformers架构:模型先生成ABC曲稿和音乐语义表示,再进一步生成声学信息并解码为48kHz立体声音频。
在训练数据方面,YuE2使用了由TokenWave.AI提供的CC0授权数据与合成数据。
从写一首新歌,到修改已有作品,再到重新演绎,YuE2用一个模型串起了从生成到编辑的完整音乐创作流程。

YuE2模型现已开放下载,并支持在消费级游戏显卡(4090)上一分钟出歌。欢迎音乐人和开发者亲自体验、微调和探索。
这仅仅是一个开始。团队期待来自社区的真实使用和反馈,并将持续迭代模型能力与创作体验,让YuE2在更多音乐场景中变得更好用、更可控。
体验YuE2:
Demo:https://map-yue2.github.io/
GitHub:https://github.com/multimodal-art-projection/YuE
Hugging Face:https://huggingface.co/m-a-p/YuE2-3B
文章来自于"量子位",作者 "YuE2 团队"。
【开源免费】suno-api是一个使用监听技术实现了调用suno功能,并封装好API的AI音乐项目。
项目地址:https://github.com/gcui-art/suno-api
【开源免费】AutoGPT是一个允许用户创建和运行智能体的(AI Agents)项目。用户创建的智能体能够自动执行各种任务,从而让AI有步骤的去解决实际问题。
项目地址:https://github.com/Significant-Gravitas/AutoGPT
【开源免费】MetaGPT是一个“软件开发公司”的智能体项目,只需要输入一句话的老板需求,MetaGPT即可输出用户故事 / 竞品分析 / 需求 / 数据结构 / APIs / 文件等软件开发的相关内容。MetaGPT内置了各种AI角色,包括产品经理 / 架构师 / 项目经理 / 工程师,MetaGPT提供了一个精心调配的软件公司研发全过程的SOP。
项目地址:https://github.com/geekan/MetaGPT/blob/main/docs/README_CN.md
【开源免费】graphrag是微软推出的RAG项目,与传统的通过 RAG 方法使用向量相似性作为搜索技术不同,GraphRAG是使用知识图谱在推理复杂信息时大幅提高问答性能。
项目地址:https://github.com/microsoft/graphrag
【开源免费】Dify是最早一批实现RAG,Agent,模型管理等一站式AI开发的工具平台,并且项目方一直持续维护。其中在任务编排方面相对领先对手,可以帮助研发实现像字节扣子那样的功能。
项目地址:https://github.com/langgenius/dify
【开源免费】RAGFlow是和Dify类似的开源项目,该项目在大文件解析方面做的更出色,拓展编排方面相对弱一些。
项目地址:https://github.com/infiniflow/ragflow/tree/main
【开源免费】phidata是一个可以实现将数据转化成向量存储,并通过AI实现RAG功能的项目
项目地址:https://github.com/phidatahq/phidata
【开源免费】TaskingAI 是一个提供RAG,Agent,大模型管理等AI项目开发的工具平台,比LangChain更强大的中间件AI平台工具。
项目地址:https://github.com/TaskingAI/TaskingAI
【开源免费】XTuner 是一个高效、灵活、全能的轻量化大模型微调工具库。它帮助开发者提供一个简单易用的平台,可以对大语言模型(LLM)和多模态图文模型(VLM)进行预训练和轻量级微调。XTuner 支持多种微调算法,如 QLoRA、LoRA 和全量参数微调。
项目地址:https://github.com/InternLM/xtuner
【开源免费】LangGPT 是一个通过结构化和模板化的方法,编写高质量的AI提示词的开源项目。它可以让任何非专业的用户轻松创建高水平的提示词,进而高质量的帮助用户通过AI解决问题。
项目地址:https://github.com/langgptai/LangGPT/blob/main/README_zh.md
在线使用:https://kimi.moonshot.cn/kimiplus/conpg00t7lagbbsfqkq0