GPT-SoVITS

开源声音克隆与文本转语音工具,仅需1分钟音频即可训练个性化TTS模型,中文效果极佳,支持零样本与小样本模式。

Github 🆓 免费 🔓 开源
✨ 5秒零样本即时语音克隆✨ 1分钟微调实现高还原度✨ 中文支持最优的开源TTS✨ 内置WebUI一站式训练工具✨ 支持中英日跨语言推理
🌐 访问官网 →

产品概述

GPT-SoVITS 是一个基于 Python 的开源语音克隆与文本转语音框架,采用 RAG 架构。它主打“低成本、高还原”,只需 5 秒的音频样本就能实现零样本即时 TTS,或者用 1 分钟的训练数据微调出音色更接近原声的模型。尤其擅长中文,是目前中文支持最出色的开源 TTS 方案之一。

核心优势