DreamTalk

一个由清华、阿里和华中科大联合开发的AI框架,能让静态照片根据音频(包括歌曲、多种语言)说话,并生成自然生动的表情和唇动。

Github 🆓 免费
✨ 三组件协同:去噪网络+风格唇专家+风格预测器✨ 无需表情参考视频或文本✨ 支持歌曲、多语言及嘈杂音频✨ 生成高质量、富有表现力面部动画✨ 跨数据集泛化能力强
🌐 访问官网 →

产品概述

DreamTalk是基于扩散模型的说话人脸生成框架,由清华大学、阿里巴巴和华中科技大学共同开发。它可以将一张静态人物照片转化为会根据音频说话的视频,支持歌曲、多种语言语音甚至嘈杂音频,并能生成不同的表情风格。核心在于三个组件:降噪网络、风格感知嘴唇专家和风格预测器,协同工作实现高保真、富有表现力的面部动画。

核心优势

DreamTalk利用扩散模型的强大能力,在去噪过程中逐步生成清晰的面部动作,使得不同表情下的一致性显著提升。相比传统方法,它不需要表情参考视频或文本,而是通过风格预测器直接从音频预测目标表情,大幅降低了使用门槛。同时,风格感知的嘴唇专家能根据说话风格精准指导唇部同步,使生成的动画既准确又自然。实验表明,它在处理未见过的面部类型、表情和多样性语言方面表现突出,超越了现有同类产品。

适用场景