Spark-TTS

基于Qwen2.5的文本转语音系统,支持零样本语音克隆、多语言合成和细粒度语音控制,直接通过LLM预测编码生成高质量音频。

voice 🆓 免费 🔓 开源
✨ 基于Qwen2.5的大模型TTS✨ 零样本语音克隆无需训练数据✨ 细粒度控制音调、语速与性别✨ 支持中英文跨语言合成✨ 提供Web UI与开源社区支持
🌐 访问官网 →

产品概述

Spark-TTS 是由 SparkAudio 团队开发的开源文本转语音系统,采用 Qwen2.5 大语言模型作为核心架构。它打破传统TTS流程,直接从LLM预测的编码中重建音频,无需额外的生成模型,大幅简化了语音合成流水线。系统支持中文和英文,能够实现零样本语音克隆,即使没有目标说话人的训练数据也能模仿其声音特点。

核心优势

**高度可控性**:用户可通过调整性别、音高、语速等参数自定义虚拟说话者,甚至创建独一无二的语音风格。这得益于 BiCodec 单流语音编解码器将语音分解为语义标记和全局风格标记,实现了语言内容和说话者属性的分离。 **零样本与跨语言能力**:在跨语言和代码切换场景中表现优秀,用一种语言输入文本即可输出另一种语言的语音,并保持自然度。零样本克隆让声音复制变得简单高效。 **简单易用的体验**:提供Web UI界面,无需编程即可进行语音生成。命令行工具和完整的API也方便开发者集成。模型权重已在Hugging Face开放,社区可自由下载使用。

适用场景