产品概述
Voicebox是Meta AI推出的一种非自回归流匹配语音生成模型。它通过大规模文本引导的语音填充任务进行训练,学习如何根据上下文和文字指令生成、修复或转换语音。与传统的自回归模型不同,Voicebox可以同时利用过去和未来的上下文信息,因此在语音编辑、噪声去除、风格迁移等任务上表现出色,并且速度比同类模型快20倍。它支持英语、法语、德语、西班牙语、波兰语和葡萄牙语六种语言,能处理复杂的跨语言场景。
核心优势
**灵活的多任务能力**:Voicebox无需为每个任务单独训练,通过上下文学习就能完成文本到语音合成、语音内容编辑、瞬时噪声去除、风格迁移以及多样性语音采样。例如,你可以用两秒的音频样本匹配其风格,然后让模型朗读任意文字,或者将录好的音频中的狗叫声一键替换为自然语音。
**高质量与高效率**:模型在50,000+小时的语音数据上训练,生成的语音自然、高保真。同时,由于采用非自回归架构,生成速度远快于自回归模型,非常适合实时或大规模部署。
**跨语言风格迁移**:这是Voicebox的亮点之一。它可以将说话人的音色和风格迁移到另一种语言的语音中,即使原音频和目标文本语言不同。例如,给一段英语语音,让模型用相同的语气朗读法语文本。
适用场景
- 音频后期制作:去除录制中的噪声(如门铃、狗吠),重新生成说错的词句,无需重录。
- 多语言语音助手:为虚拟助手或元宇宙角色提供自然的多语言语音。
- 辅助工具:帮助视障人士用熟悉的声音朗读朋友发来的不同语言的文字消息。
- 创意视频制作:快速生成风格多样的配音,提升创作效率。