产品概述
Step-Video-T2V 是由阶跃星辰与吉利汽车联合开源的大规模文本到视频生成模型。它采用 DiT 架构和流匹配训练方法,在视频生成领域实现了显著突破,能够将文字描述直接转化为高分辨率、高流畅度的视频内容。模型参数量高达 300 亿,支持最长 204 帧(544×992 像素)的视频输出,并且深度压缩了变分自编码器,大幅提升生成效率。
核心优势
- **惊人参数与高效生成**:300 亿参数让模型能精准理解复杂文本,生成细节丰富的视频。通过 Video-VAE 实现 16×16 空间压缩和 8× 时间压缩,在保证画质的同时降低计算成本,204 帧视频仅需约 12 分钟(4 块 80GB GPU)。
- **双语理解与先进架构**:内置中英文双语文本编码器,方便不同语言用户。3D 全注意力 DiT 架构可自适应动态分辨率,并引入视频偏好优化(DPO)机制,通过人类反馈提升视频平滑度和真实感。
- **多模态融合与灵活版本**:融合图像、语音、文本多模态能力,生成的人物表情、光影变化更自然。提供基础版(50步)和 Turbo 版(15步蒸馏加速),满足不同场景对速度与质量的需求。
适用场景
- **创意视频制作**:帮助广告、短视频创作者快速生成复杂场景和创意内容。
- **动画与影视制作**:用于虚拟角色、动态场景和复杂动作的生成,降低制作成本。
- **教育与培训**:创建互动教学视频,提升学习趣味性。
- **娱乐产业**:自动生成游戏 CG、电影预告片等,节省人力。
- **文化传播**:擅长水墨画、古风等中国风美学内容,助力传统文化数字化。