产品概述
Phenaki 是 Google Research 的一个实验性项目,旨在从开放域的文本描述中合成逼真的视频。与许多需要大量视频数据训练的模型不同,Phenaki 利用图像-文本对和少量视频-文本示例,就能生成高质量、可变长度(最长两分钟)的视频,甚至可以处理随时间变化的提示(如故事剧情)。
核心优势
Phenaki 的视频编码器-解码器在时空质量和每个视频的令牌数量上优于传统的逐帧基线方法。它使用双向掩码转换器,以预先计算的文本令牌为条件,生成视频令牌,再通过去令牌化得到最终视频。这使得 Phenaki 能应对开放域提示和时间变量提示,突破了以往受限于数据量和计算成本的瓶颈。
此外,Phenaki 支持从静止图像结合文本提示生成视频,例如“放大猫的眼睛”或“让猫打哈欠”。这种灵活性让视频创作门槛大大降低,只需一段文字描述就能生成连贯的动态内容。
适用场景
- 娱乐内容生成:根据故事或创意脚本快速生成视频片段。
- 教育与教学:将抽象概念转化为动态可视化内容。
- 艺术创作:艺术家可用文字描述生成独特视频作品。
- 短视频制作:从简单提示自动生成短视频素材。