VideoPoet

Google的多模态视频生成工具,能用文字、图片、音频一键生成视频,还能做风格化、修复和配音。

video 🎁 分层付费
✨ 基于LLM的多模态视频生成✨ 支持文本、图像、音频等多种输入✨ 集视频风格化、修复、配音于一体✨ 生成视频长度可达8-10秒,连贯性好✨ 无需技术技能,操作简单快速
🌐 访问官网 →

产品概述

VideoPoet 是 Google 研发的一款多模态视频生成工具,它不同于传统的扩散模型,而是基于大型语言模型(LLM)构建。你可以输入文本、图片甚至音频,让 AI 自动生成对应的视频内容,还支持视频风格化、局部修复、外绘画以及视频到音频的生成。简单来说,就是把多种视频创作能力打包进一个模型,像跟 AI 聊天一样快速出片。

核心优势

首先,VideoPoet 将文本、图像、音频多种输入统一在一个 LLM 框架里,不需要切换不同工具就能完成从创意到成片的全流程。它采用预训练加任务适配的两步训练法,基础大模型学到的通用知识可以灵活迁移到各类视频生成任务,效果更稳定。 其次,它能生成比大多数 AI 视频工具更长的视频——虽然首段只能生成 2 秒,但后续可以延续到 8-10 秒,并且保持画面上下文连贯。操作也极其简单,不需要任何技术背景,登录网站选好输入类型和风格,几分钟就能得到一段可编辑的精美视频,还能直接下载为 MP4 或分享到社交媒体。

适用场景