UniVG

百度开源的统一视频生成系统,支持文本和图像任意组合输入,灵活生成高质量视频,媲美Gen2。

Github 🆓 免费 🔓 开源
✨ 文本+图像任意组合输入✨ 高自由度和低自由度双模式✨ 开源免费,社区活跃✨ 生成质量媲美Gen2✨ 支持多种视频生成任务
🌐 访问官网 →

产品概述

UniVG是百度团队推出的统一模式AI视频生成系统,基于扩散模型技术,能够接受文本、图像或两者组合作为输入条件,灵活生成与语义一致的高质量视频。它解决了现有视频生成模型只能处理单一任务或单一目标的局限性,通过高自由度和低自由度两种生成模式,覆盖从创意构思到精准还原的多种需求。项目已在GitHub开源,社区可以自由使用和二次开发。

核心优势

**高自由度与低自由度双模式**:高自由度模式采用多条件交叉注意力机制,根据输入的图像或文本生成语义一致的视频,适合创意发散;低自由度模式引入偏置高斯噪声替代完全随机噪声,更好地保留输入条件的内容细节,适合需要精确还原的场景。 **灵活多变的输入方式**:用户可单独使用文本、图像,或同时输入文本和图像作为条件,满足实际应用中的复杂需求。例如,用图像指定主体轮廓,用文本描述动作或场景,实现精准控制。 **业界领先的生成质量**:在MSR-VTT数据库上取得最低的FVD(Fréchet Video Distance),人类评估中超越现有开源方法,与闭源商业方案Gen2相当。

适用场景