ChatTTS

一个专为对话场景设计的开源文本转语音模型,能自然地生成中英文语音,支持语速、情感等细粒度控制。

voice 🆓 免费 🔓 开源
✨ 专为对话场景优化✨ 支持中英文混合✨ 能控制笑声、停顿等韵律✨ 开源基础模型✨ 语速/情感可调节
🌐 访问官网 →

产品概述

ChatTTS 是一个专注于对话式文本转语音的开源模型,主要面向需要自然、流畅语音合成的场景。它经过超过 10 万小时的中英文数据训练,能生成高质量的语音,并支持多种说话人风格和细粒度的韵律控制。模型最早在 GitHub 上开源,提供了 4 万小时数据训练的基础版本,方便研究和二次开发。

核心优势

对话优化与自然度:与通用 TTS 模型不同,ChatTTS 专门针对对话任务优化,能准确模拟人类对话中的停顿、笑声、插话等细节,让合成语音更自然、更贴近真实交流。 细粒度控制:用户可调整语速、音调、情感(如高兴、悲伤)等属性,甚至能控制特定位置的停顿或笑声,极大提升了语音的灵活性和表现力。 多语言与易用性:支持中文和英文,且能实现中英文混合合成。使用简单,只需几行 Python 代码即可生成语音文件,方便集成到各类应用中。

适用场景