产品概述
DreamTalk是基于扩散模型的说话人脸生成框架,由清华大学、阿里巴巴和华中科技大学共同开发。它可以将一张静态人物照片转化为会根据音频说话的视频,支持歌曲、多种语言语音甚至嘈杂音频,并能生成不同的表情风格。核心在于三个组件:降噪网络、风格感知嘴唇专家和风格预测器,协同工作实现高保真、富有表现力的面部动画。
核心优势
DreamTalk利用扩散模型的强大能力,在去噪过程中逐步生成清晰的面部动作,使得不同表情下的一致性显著提升。相比传统方法,它不需要表情参考视频或文本,而是通过风格预测器直接从音频预测目标表情,大幅降低了使用门槛。同时,风格感知的嘴唇专家能根据说话风格精准指导唇部同步,使生成的动画既准确又自然。实验表明,它在处理未见过的面部类型、表情和多样性语言方面表现突出,超越了现有同类产品。
适用场景
- 影视制作:快速生成虚拟角色的逼真表情和口型,减少动捕成本。
- 人机交互:为虚拟助手、数字人赋予自然的面部反应,提升交流真实感。
- 内容创作:让历史人物照片、艺术作品等“开口说话”,用于教育或娱乐。
- 多语言应用:支持多种语言和歌曲音频,适合国际化场景。