产品概述
TangoFlux是由新加坡科技设计大学(SUTD)和NVIDIA共同研发的一款文本到音频(TTA)生成模型。它拥有约5.15亿参数,可在单个A40 GPU上仅用3.7秒生成最长30秒的44.1kHz立体声音频,不仅支持鸟叫、口哨、爆炸等常见音效,还能创作音乐片段。模型基于变分自编码器、文本与时长嵌入、FluxTransformer架构以及流匹配技术,并引入CLAP-Ranked Preference Optimization框架迭代优化音频与文本的对齐质量,训练数据全部来自非专有数据集,因此开放可访问,便于研究与应用拓展。
核心优势
**极速生成与高音质**:TangoFlux在1秒内就能产出数秒音频,且生成质量清晰,能忠实还原各类声音事件,满足对响应速度和听觉体验都有高要求的场景。
**长时长与多样内容**:支持生成长达30秒的音频,覆盖音效与音乐两种类别,创作者无需复杂配置即可获得丰富的音频素材。
**对齐能力持续优化**:通过CRPO框架不断生成偏好数据对,让模型生成的音频更贴合用户意图,减少输出与文本描述之间的偏差。
适用场景
- 影视与游戏音频制作:快速生成配乐、声效或配音,缩短制作周期,降低人力成本。
- 音乐创作灵感源:按给定风格或情绪生成音乐片段,帮助突破创作瓶颈。
- VR/AR体验增强:根据虚拟环境实时生成逼真音频,提升沉浸感和交互性。
- 广告营销音频创新:依据品牌形象和创意要求,生成独特声音元素,促进消费者共鸣。