StableAvatar

只需一段音频和一张照片,就能生成口型精准、表情自然的长视频,人物形象始终稳定,告别崩脸烦恼。

Github 🆓 免费
✨ 任意时长高保真视频生成✨ 口型与音频精准同步✨ 长视频画面无卡顿、不崩脸✨ 无需后期修脸,即生成即用✨ 基于音频引导的高质量动画
🌐 访问官网 →

产品概述

StableAvatar 由复旦大学、微软亚洲研究院和西安交通大学联合研发,是一项突破性的音频驱动视频生成技术。与传统方法只能生成十几秒的短视频不同,StableAvatar 能根据任意长度的音频(说话或唱歌)生成高保真、时长不受限制的视频,且人物面部和身体姿态始终保持一致,不会出现变形或跳跃。

核心优势

**超长视频稳定输出**:利用动态加权滑动窗口去噪策略,在时间维度上融合画面潜变量信息,让长视频的每一帧过渡平滑自然,彻底解决了以往生成长视频时画面卡顿、不连贯的问题。 **精准口型同步**:独创的时间步感知音频适配器优化音频特征,配合音频原生引导机制在推理阶段动态校正,确保声音与嘴型完全匹配,即使快速说话或唱歌也不会对不上。 **无需后期修复**:生成的人物外观从头到尾保持一致,脸部不会变形、身体比例协调,省去了使用 FaceFusion、GFP-GAN 等工具修脸的麻烦,直接产出可用视频。

适用场景