产品概述
JoyGen 是由京东科技与香港大学合作推出的两阶段音频驱动3D说话人脸视频生成框架。它通过音频输入驱动3D深度感知模型,精确模拟说话者的唇部动作和面部表情,生成逼真的视频。项目使用包含130小时高质量中文视频的数据集与开放的HDTF数据集联合训练,支持中文和英文输入,并融入了音频情绪特征,让人物动画自然展现微笑、皱眉等情感变化。
核心优势
- **精准唇部同步**:利用3D重建模型提取面部身份特征,结合音频到运动模型将音频信号转化为表情系数,通过可微渲染生成面部深度图,实现唇形与音频的完美匹配。
- **单步UNet高效合成**:采用单步UNet架构整合音频特征与深度图,直接生成视频帧;引入跨注意力机制增强唇部与音频的一致性,并通过L1损失优化像素级与潜在空间质量。
- **视频编辑优化**:不仅生成新视频,还能对现有视频进行唇部运动编辑,无需从头渲染整个序列,大幅提升编辑效率。
- **情绪自然表达**:音频情绪特征被纳入模型,使生成的说话人脸能根据音频语气自动呈现相应的情感表情,提升真实感。
适用场景
- **虚拟会议**:增强数字人的面部表达,使远程沟通更生动。
- **影视制作**:快速生成或编辑角色唇部动画,降低特效成本。
- **教育培训**:制作口型同步的教学视频或虚拟讲师。
- **AI助手**:提升人机交互中虚拟形象的拟人化程度。
- **数字人内容创作**:简化高质量说话人脸视频的生成流程。