产品概述
Emote Portrait Alive(简称EMO)是阿里巴巴发布的一款基于音频驱动的AI肖像视频生成框架。你只需提供一张参考图像(比如人物照片)和一段声音音频(说话或唱歌),EMO就能自动生成一个表情丰富、头部姿态自然的视频,让照片中的人物仿佛“活”了过来,跟着音频内容张嘴说话或唱歌。整个过程无需依赖预录视频片段或复杂3D模型,完全由AI端到端生成。
核心优势
EMO的核心在于其高表现力与逼真度。它不仅能捕捉人类面部表情的细微差别,包括微妙的微表情,还能让头部运动与音频节奏完美匹配。通过FrameEncoding模块,它能在视频生成过程中保持角色身份的一致性,确保人物外观与输入参考图像高度一致。此外,EMO采用了速度控制器和面部区域控制器等稳定控制机制,避免了帧间抖动或面部扭曲问题,视频质量非常流畅。
另一个亮点是灵活的视频时长——你可以根据输入音频的长度生成任意时长的视频,不受限制。EMO的训练数据集覆盖了多种语言(中文、英文等)和多种风格(现实主义、动漫、3D等),因此它支持跨语言、跨风格的视频生成,无论是老照片、绘画还是AI生成的角色,都能被赋予生动的表情和动作。
适用场景
- **唱歌视频生成**:输入人物肖像和唱歌音频,生成与歌声同步、富有表现力的MV。
- **说话视频生成**:适用于播客、虚拟主播、教育视频等场景,让静态照片开口说话。
- **多语言支持**:可处理不同语言的音频,生成符合语种特点的肖像视频。
- **跨风格创作**:将动漫、3D模型或AI绘画作品与音频结合,创作个性化动态内容。