产品概述
UniVG是百度团队推出的统一模式AI视频生成系统,基于扩散模型技术,能够接受文本、图像或两者组合作为输入条件,灵活生成与语义一致的高质量视频。它解决了现有视频生成模型只能处理单一任务或单一目标的局限性,通过高自由度和低自由度两种生成模式,覆盖从创意构思到精准还原的多种需求。项目已在GitHub开源,社区可以自由使用和二次开发。
核心优势
**高自由度与低自由度双模式**:高自由度模式采用多条件交叉注意力机制,根据输入的图像或文本生成语义一致的视频,适合创意发散;低自由度模式引入偏置高斯噪声替代完全随机噪声,更好地保留输入条件的内容细节,适合需要精确还原的场景。
**灵活多变的输入方式**:用户可单独使用文本、图像,或同时输入文本和图像作为条件,满足实际应用中的复杂需求。例如,用图像指定主体轮廓,用文本描述动作或场景,实现精准控制。
**业界领先的生成质量**:在MSR-VTT数据库上取得最低的FVD(Fréchet Video Distance),人类评估中超越现有开源方法,与闭源商业方案Gen2相当。
适用场景
- 内容创作:快速生成短视频素材、动画片段
- 广告创意:根据产品图片和文案生成动态广告
- 娱乐与艺术:生成风格化视频、特效片段
- 教育与演示:将文本描述或示意图转化为动态讲解视频
- 科研与开发:作为视频生成基础模型进行二次研究或商业集成