一款基于XTTS和Tortoise的中英双语文本转语音模型,通过字符-拼音混合建模精准修正多音字,结合Conformer与BigVGAN2实现高保真、高自然度的语音合成。
产品概述
IndexTTS是一款专注于中文场景的开源文本转语音模型,在XTTS和Tortoise的架构上进行了深度优化。其核心创新是字符-拼音混合建模:允许输入纯文本或拼音(如“长”指定zhǎng/cháng),自动预测未标注拼音,大幅降低多音字错误率。搭配Conformer条件编码器提取音色特征、BigVGAN2解码器生成高质波形,在训练稳定性和音质上均有提升。
核心优势
- **精准的中文发音控制**:通过拼音纠错和标点停顿控制(如句号、逗号影响节奏),解决多音字和语速自然度问题。情感与音色可独立调节,情绪表达更细腻。
- **高保真音质与流畅合成**:Conformer的卷积-自注意力机制强化韵律建模,BigVGAN2基于GAN快速生成高保真波形,兼顾效率与音质。零样本语音克隆仅需参考短音频即可模仿新说话人,音色还原度高。
- **性能全面超越竞品**:在自然度、一致性、推理速度上明显超过Fish-Speech、CosyVoice2、F5-TTS等主流开源TTS,代码本利用率接近100%,无塌陷问题。
适用场景
- 智能助手与智能客服(自然交互,多轮对话)
- 有声读物与视频配音(情感饱满,停顿自然)
- 教育工具与语言学习(中英双语,精准发音)
- 个性化语音克隆与内容创作(快速复制声音)