产品概述
Spark-TTS 是由 SparkAudio 团队开发的开源文本转语音系统,采用 Qwen2.5 大语言模型作为核心架构。它打破传统TTS流程,直接从LLM预测的编码中重建音频,无需额外的生成模型,大幅简化了语音合成流水线。系统支持中文和英文,能够实现零样本语音克隆,即使没有目标说话人的训练数据也能模仿其声音特点。
核心优势
**高度可控性**:用户可通过调整性别、音高、语速等参数自定义虚拟说话者,甚至创建独一无二的语音风格。这得益于 BiCodec 单流语音编解码器将语音分解为语义标记和全局风格标记,实现了语言内容和说话者属性的分离。
**零样本与跨语言能力**:在跨语言和代码切换场景中表现优秀,用一种语言输入文本即可输出另一种语言的语音,并保持自然度。零样本克隆让声音复制变得简单高效。
**简单易用的体验**:提供Web UI界面,无需编程即可进行语音生成。命令行工具和完整的API也方便开发者集成。模型权重已在Hugging Face开放,社区可自由下载使用。
适用场景
- 有声读物制作:利用自然流畅的语音将文字转化为有声内容。
- 虚拟主播/数字人:通过参数调整生成符合角色设定的个性化声音。
- 跨语言语音助手:支持中英文混合或转换,适合国际化应用。
- 语音交互原型开发:快速生成测试语音,降低开发门槛。