CogVideo

清华大学与智源研究院联合推出的开源文本转视频模型,94亿参数,能根据文字描述生成流畅的视频内容。

coding 🆓 免费 🔓 开源
✨ 94亿参数的大规模预训练✨ 基于CogView2图像模型迁移✨ 多帧率分层训练策略✨ 支持中文输入与详细文档✨ 开源且易于定制使用
🌐 访问官网 →

产品概述

CogVideo是由清华大学与北京智源人工智能研究院(BAAI)共同开发的开源文本到视频生成模型,拥有94亿参数,是当时最大的通用领域预训练模型之一。它巧妙利用了已有的文本-图像生成模型CogView2作为基础,通过多帧率分层训练策略,将文本描述高效转化为连贯的视频序列。该模型支持中文输入,并提供详细的文档和教程,降低了研究者和开发者的使用门槛。

核心优势

CogVideo最大的亮点在于其训练策略:通过继承预训练的CogView2模型,避免了从零开始训练视频生成模型所需的巨额计算资源。多帧率分层训练使其能够先根据文本生成关键帧,再通过插帧技术补全中间帧,从而控制运动变化的强度,更好地对齐文本语义与视频内容。此外,它还能根据详细文本描述构建3D环境和动画,展现出强大的动态场景生成能力。

适用场景