TangoFlux

新加坡科技设计大学与NVIDIA联手打造的文本转音频模型,3.7秒内生成30秒高清音效或音乐,适合快速创意制作。

coding 🆓 免费 🔓 开源
✨ 仅3.7秒生成30秒44.1kHz立体声✨ 支持音效与音乐双类型生成✨ 采用CRPO强化文本-音频对齐✨ 基于开源数据集,模型开放可访问✨ 单张A40 GPU即可运行
🌐 访问官网 →

产品概述

TangoFlux是由新加坡科技设计大学(SUTD)和NVIDIA共同研发的一款文本到音频(TTA)生成模型。它拥有约5.15亿参数,可在单个A40 GPU上仅用3.7秒生成最长30秒的44.1kHz立体声音频,不仅支持鸟叫、口哨、爆炸等常见音效,还能创作音乐片段。模型基于变分自编码器、文本与时长嵌入、FluxTransformer架构以及流匹配技术,并引入CLAP-Ranked Preference Optimization框架迭代优化音频与文本的对齐质量,训练数据全部来自非专有数据集,因此开放可访问,便于研究与应用拓展。

核心优势

**极速生成与高音质**:TangoFlux在1秒内就能产出数秒音频,且生成质量清晰,能忠实还原各类声音事件,满足对响应速度和听觉体验都有高要求的场景。 **长时长与多样内容**:支持生成长达30秒的音频,覆盖音效与音乐两种类别,创作者无需复杂配置即可获得丰富的音频素材。 **对齐能力持续优化**:通过CRPO框架不断生成偏好数据对,让模型生成的音频更贴合用户意图,减少输出与文本描述之间的偏差。

适用场景