JoyGen

京东与港大联合开发的音频驱动3D说话人脸视频生成框架,实现精准唇形同步和情感表达,支持中英文输入。

Github 🆓 免费 🔓 开源
✨ 音频驱动唇形与情感同步✨ 支持中英文双语音频输入✨ 单步UNet高效架构✨ 可进行现有视频唇部编辑✨ 开源免费,GitHub可获取
🌐 访问官网 →

产品概述

JoyGen 是由京东科技与香港大学合作推出的两阶段音频驱动3D说话人脸视频生成框架。它通过音频输入驱动3D深度感知模型,精确模拟说话者的唇部动作和面部表情,生成逼真的视频。项目使用包含130小时高质量中文视频的数据集与开放的HDTF数据集联合训练,支持中文和英文输入,并融入了音频情绪特征,让人物动画自然展现微笑、皱眉等情感变化。

核心优势