产品概述
AudioBox是由Meta(原Facebook)研发的尖端AI音频生成模型,能够通过文本描述或语音输入自动生成逼真的语音、音效和音乐。它融合了自然语言理解与声音合成技术,用户只需输入“一条流淌的河流和鸟儿在鸣叫”之类的提示,即可得到匹配的音频。该工具在发布时不需要注册即可在线试用,但根据官网信息,其公开演示已于2026年2月正式关闭,目前仅保留研究页面供学术参考。
核心优势
- **双模态输入**:支持文本和语音同时控制,既能录制样本声音,又能用文字描述修改风格或生成全新内容,实现“用语言调音”的灵活体验。
- **多功能集成**:覆盖语音生成(如配音、有声书)、音效创作(游戏、电影)、声音修复与填充(拖拽区域并描述替换效果),一个模型完成多种音频任务。
- **多语言与可定制**:支持多种语言的内容生成,并能根据应用场景(教育、营销、音乐制作)定制个性化音频签名,提升交互沉浸感。
适用场景
- **内容创作**:为视频、播客、有声读物自动配音或生成背景音效。
- **游戏与VR**:快速生成环境音效(水流、鸟鸣)、角色语音或动态音频反馈。
- **辅助技术**:帮助语言障碍者通过自然语言描述获取特定语音输出,增强交流工具。
- **研究与教育**:作为AI音频合成的实验平台,或制作互动教学材料的语音模块。