Emote Portrait Alive

阿里巴巴推出的AI神器,上传一张照片和一段音频,就能让照片里的人物活灵活现地说话或唱歌,表情和头部动作超级逼真。

Github 🆓 免费
✨ 音频驱动,无需预录视频✨ 表情与头部动作极其逼真✨ 支持任意时长视频生成✨ 跨语言跨风格灵活应用✨ 保持角色身份一致性
🌐 访问官网 →

产品概述

Emote Portrait Alive(简称EMO)是阿里巴巴发布的一款基于音频驱动的AI肖像视频生成框架。你只需提供一张参考图像(比如人物照片)和一段声音音频(说话或唱歌),EMO就能自动生成一个表情丰富、头部姿态自然的视频,让照片中的人物仿佛“活”了过来,跟着音频内容张嘴说话或唱歌。整个过程无需依赖预录视频片段或复杂3D模型,完全由AI端到端生成。

核心优势

EMO的核心在于其高表现力与逼真度。它不仅能捕捉人类面部表情的细微差别,包括微妙的微表情,还能让头部运动与音频节奏完美匹配。通过FrameEncoding模块,它能在视频生成过程中保持角色身份的一致性,确保人物外观与输入参考图像高度一致。此外,EMO采用了速度控制器和面部区域控制器等稳定控制机制,避免了帧间抖动或面部扭曲问题,视频质量非常流畅。 另一个亮点是灵活的视频时长——你可以根据输入音频的长度生成任意时长的视频,不受限制。EMO的训练数据集覆盖了多种语言(中文、英文等)和多种风格(现实主义、动漫、3D等),因此它支持跨语言、跨风格的视频生成,无论是老照片、绘画还是AI生成的角色,都能被赋予生动的表情和动作。

适用场景