InspireMusic

阿里巴巴通义实验室开源的音乐生成框架,支持文本描述或音频输入创作多种风格音乐,提供训练调优工具,助力开发者和音乐爱好者。

Github 🆓 免费 🔓 开源
✨ 开源免费,技术架构先进✨ 支持文本与音频多模态输入✨ 可生成超5分钟高质量音乐✨ 提供模型微调与推理工具✨ 覆盖音乐、歌曲、音效合成
🌐 访问官网 →

产品概述

InspireMusic是由阿里巴巴通义实验室推出的开源音乐生成框架,基于音频大模型技术,集成了多项音频领域前沿研究成果。它支持通过文本描述或音频输入进行智能化音乐创作,包括音乐生成、风格转换、音频合成等全流程解决方案。该框架同时提供了完整的模型调优工具链,方便开发者和研究者根据需求定制模型。

核心优势

InspireMusic采用高压缩比单码本WavTokenizer将音频转化为离散token,结合自回归Transformer模型(基于Qwen初始化)根据文本预测音频序列,再利用Conditional Flow Matching扩散模型恢复高质量音频特征,最后通过Vocoder生成波形。这种架构使得音乐生成连贯且自然,支持24kHz和48kHz采样率,可生成超过5分钟的长音频。 框架提供了统一的音频生成能力,不仅支持纯音乐,还支持歌曲和人声合成。用户可以通过文本提示精确控制音乐风格、情感和结构,实现灵活可控的生成。同时,它内置了简便的模型微调和推理工具,降低了使用门槛,即使非专业用户也能快速上手。

适用场景