产品概述
StableAvatar 由复旦大学、微软亚洲研究院和西安交通大学联合研发,是一项突破性的音频驱动视频生成技术。与传统方法只能生成十几秒的短视频不同,StableAvatar 能根据任意长度的音频(说话或唱歌)生成高保真、时长不受限制的视频,且人物面部和身体姿态始终保持一致,不会出现变形或跳跃。
核心优势
**超长视频稳定输出**:利用动态加权滑动窗口去噪策略,在时间维度上融合画面潜变量信息,让长视频的每一帧过渡平滑自然,彻底解决了以往生成长视频时画面卡顿、不连贯的问题。
**精准口型同步**:独创的时间步感知音频适配器优化音频特征,配合音频原生引导机制在推理阶段动态校正,确保声音与嘴型完全匹配,即使快速说话或唱歌也不会对不上。
**无需后期修复**:生成的人物外观从头到尾保持一致,脸部不会变形、身体比例协调,省去了使用 FaceFusion、GFP-GAN 等工具修脸的麻烦,直接产出可用视频。
适用场景
- **电影与视频制作**:生成高难度动作场景、角色动画、修复老影片。
- **游戏开发**:打造真实角色动画、过场动画、虚拟 NPC 互动。
- **VR/AR 应用**:创建逼真虚拟角色用于社交、旅游。
- **社交媒体与直播**:搭建形象统一的虚拟主播,制作创意短视频。
- **教育与客服**:生成外貌一致的虚拟老师或客服,提供个性化服务。
- **广告与数字营销**:制作电影级广告短片,展现复杂人物动作。