M2UGen

腾讯推出的多模态音乐生成模型,支持从文本、图片、视频或音频生成、编辑音乐,还能进行音乐问答,帮你轻松创作个性化配乐。

Github 🆓 免费 🔓 开源
✨ 支持文本/图像/视频/音频多模态输入✨ 可基于已有音频编辑节奏和乐器✨ 集成LLaMA 2实现自然语言指令控制✨ 结合MERT、ViT、ViViT等专业编码器✨ 开源项目,社区可自由使用和定制
🌐 访问官网 →

产品概述

M2UGen 是腾讯发布的一款前沿多模态音乐理解与生成框架。它不仅能从文字生成音乐,还能根据图片、视频甚至现有音频创作或编辑音乐,并支持音乐相关的问答。简单来说,你给它一张夕阳照片或一段猫跳舞的视频,它就能配上合适的背景音乐;你还可以指定调整节奏、替换乐器等,让音乐更符合你的创意。

核心优势

M2UGen 的核心在于“多模态理解 + 生成”的结合。它利用多个专业编码器(如 MERT 理解音乐、ViT 理解图像、ViViT 理解视频)来捕捉不同输入的含义,再通过 MusicGen/AudioLDM2 解码器生成高品质音乐。同时,它集成了 LLaMA 2 大语言模型作为“大脑”,让你可以用自然语言指令来控制生成过程,比如“把这段音乐变得更快”或“去掉吉他声音”。 另一个亮点是它的音乐编辑能力。你可以基于已有的音频进行智能修改,比如移除某个乐器、改变节奏或速度,而不需要专业的音频编辑知识。这使得音乐创作门槛大大降低,无论是专业人士还是爱好者都能快速上手。

适用场景