Audio2Photoreal

Meta AI开源项目,能从音频生成全身逼真虚拟人,包括面部表情、手势和身体动作,支持多人对话场景,效果自然生动。

Github 🆓 免费 🔓 开源
✨ 从音频生成全身逼真虚拟人✨ 支持多人对话场景✨ 面部表情与手势同步生成✨ 结合向量量化与扩散模型✨ 开源代码与论文可供研究
🌐 访问官网 →

产品概述

Audio2Photoreal是由Meta AI(Facebook Research)推出的一项前沿技术,能够仅凭音频输入生成全身逼真的虚拟人物形象。它不仅能根据多人对话中的语音生成对应的面部表情,还能精准还原手势、身体动作(如指点、耸肩、微笑)等细节,让虚拟人物在视觉上高度逼真且动作自然。该技术结合了向量量化(VQ)的样本多样性和扩散模型的高频细节生成能力,使得输出既丰富又细腻。

核心优势