产品概述
Goku是由香港大学与字节跳动联合开发的多模态视频生成模型,基于创新的校正流Transformer架构,能够同时处理文本到视频、图像到视频以及文本到图像生成任务。它通过大规模数据训练和高效的多阶段策略,实现了低成本、高速度的内容生产,尤其在广告营销和电商领域展现出颠覆性价值。
核心优势
Goku采用校正流框架,结合图像-视频联合VAE和全注意力Transformer,显著减少传统扩散模型的迭代步骤,提升生成效率。多阶段训练策略(图文对齐、联合训练、微调)确保模型在时序连贯性和细节精度上表现优异。在MSR-VTT和UCF-101等基准测试中,Goku的文本到视频生成性能领先同类模型20%以上。
另一个突出优势是极低的成本。Goku+商业版本将视频广告制作成本降至传统拍摄的1/100,同时支持个性化定制,如品牌Logo植入和多语言配音。它提供轻量版、标准版和企业版三种规模,适配从移动端到4K分辨率的多种场景,并通过火山引擎平台实现云端API调用或本地部署。
适用场景
- 电商与广告:用一张产品图生成虚拟主播讲解、多角度展示的广告视频,大幅降低制作周期和成本。
- 社交媒体内容:输入食材或步骤描述,自动生成吃播或教程视频,辅助UGC创作者快速产出短视频。
- 影视与游戏预制作:通过文本生成剧情分镜或NPC动作序列,加速创意可视化与开发流程。