Phenaki

Google Research推出的视频合成工具,能从文本直接生成逼真视频,支持长达数分钟的复杂场景,还能通过图片+提示生成动态内容。

video 🆓 免费
✨ 直接从文本生成最长两分钟视频✨ 支持开放域和时间变化提示✨ 可由静止图像加提示生成视频✨ 利用图像-文本对减少视频数据依赖✨ 突破视频合成数据与计算限制
🌐 访问官网 →

产品概述

Phenaki 是 Google Research 的一个实验性项目,旨在从开放域的文本描述中合成逼真的视频。与许多需要大量视频数据训练的模型不同,Phenaki 利用图像-文本对和少量视频-文本示例,就能生成高质量、可变长度(最长两分钟)的视频,甚至可以处理随时间变化的提示(如故事剧情)。

核心优势

Phenaki 的视频编码器-解码器在时空质量和每个视频的令牌数量上优于传统的逐帧基线方法。它使用双向掩码转换器,以预先计算的文本令牌为条件,生成视频令牌,再通过去令牌化得到最终视频。这使得 Phenaki 能应对开放域提示和时间变量提示,突破了以往受限于数据量和计算成本的瓶颈。 此外,Phenaki 支持从静止图像结合文本提示生成视频,例如“放大猫的眼睛”或“让猫打哈欠”。这种灵活性让视频创作门槛大大降低,只需一段文字描述就能生成连贯的动态内容。

适用场景