Goku

港大与字节跳动联合研发的多模态视频生成模型,能用文本或图片快速生成高质量视频,成本极低,适合广告、电商等内容创作。

video 🎁 分层付费
✨ 多模态生成:文本/图转视频与图像✨ 校正流Transformer架构提效✨ 成本仅为传统拍摄的1/100✨ SOTA性能,领先同类20%+✨ 支持逐帧编辑与风格化控制
🌐 访问官网 →

产品概述

Goku是由香港大学与字节跳动联合开发的多模态视频生成模型,基于创新的校正流Transformer架构,能够同时处理文本到视频、图像到视频以及文本到图像生成任务。它通过大规模数据训练和高效的多阶段策略,实现了低成本、高速度的内容生产,尤其在广告营销和电商领域展现出颠覆性价值。

核心优势

Goku采用校正流框架,结合图像-视频联合VAE和全注意力Transformer,显著减少传统扩散模型的迭代步骤,提升生成效率。多阶段训练策略(图文对齐、联合训练、微调)确保模型在时序连贯性和细节精度上表现优异。在MSR-VTT和UCF-101等基准测试中,Goku的文本到视频生成性能领先同类模型20%以上。 另一个突出优势是极低的成本。Goku+商业版本将视频广告制作成本降至传统拍摄的1/100,同时支持个性化定制,如品牌Logo植入和多语言配音。它提供轻量版、标准版和企业版三种规模,适配从移动端到4K分辨率的多种场景,并通过火山引擎平台实现云端API调用或本地部署。

适用场景