Voicebox

Meta AI开发的语音生成模型,能像橡皮擦一样去除噪音、转换风格、跨语言朗读,速度飞快还支持六种语言。

voice 🆓 免费
✨ 六种语言跨风格语音迁移✨ 两秒音频即可匹配风格合成✨ 像橡皮擦一样去除噪声✨ 比自回归模型快20倍✨ 非自回归流匹配架构
🌐 访问官网 →

产品概述

Voicebox是Meta AI推出的一种非自回归流匹配语音生成模型。它通过大规模文本引导的语音填充任务进行训练,学习如何根据上下文和文字指令生成、修复或转换语音。与传统的自回归模型不同,Voicebox可以同时利用过去和未来的上下文信息,因此在语音编辑、噪声去除、风格迁移等任务上表现出色,并且速度比同类模型快20倍。它支持英语、法语、德语、西班牙语、波兰语和葡萄牙语六种语言,能处理复杂的跨语言场景。

核心优势

**灵活的多任务能力**:Voicebox无需为每个任务单独训练,通过上下文学习就能完成文本到语音合成、语音内容编辑、瞬时噪声去除、风格迁移以及多样性语音采样。例如,你可以用两秒的音频样本匹配其风格,然后让模型朗读任意文字,或者将录好的音频中的狗叫声一键替换为自然语音。 **高质量与高效率**:模型在50,000+小时的语音数据上训练,生成的语音自然、高保真。同时,由于采用非自回归架构,生成速度远快于自回归模型,非常适合实时或大规模部署。 **跨语言风格迁移**:这是Voicebox的亮点之一。它可以将说话人的音色和风格迁移到另一种语言的语音中,即使原音频和目标文本语言不同。例如,给一段英语语音,让模型用相同的语气朗读法语文本。

适用场景