MimicMotion

腾讯和上交大联合开源,输入任意动作引导就能生成高质量、任意长度的人体视频,支持面部和唇形同步,跳舞数字人效果超阿里通义舞王。

Github 🆓 免费 🔓 开源
✨ 支持任意长度视频生成✨ 置信感知姿态控制更精准✨ 面部和唇形同步能力✨ 有效减少图像扭曲形变✨ 开源且提供ComfyUI版本
🌐 访问官网 →

产品概述

MimicMotion 是一个基于扩散模型的可控视频生成框架,由腾讯与上海交通大学联合提出。它能够根据用户提供的参考图像和任意动作序列(如姿态骨架),生成细节丰富、时序连贯的高质量人体动作视频。与阿里通义舞王等同类工具相比,MimicMotion 在视频长度、动作控制精度和画面保真度上都有显著提升,并且支持面部特征和唇形同步,因此不仅能做跳舞视频,还能用于数字人创作。

核心优势

**置信感知姿态引导**:系统会对输入的姿态估计结果进行置信度评分,高置信区域在训练和推理中赋予更大权重,从而自适应调整姿态控制强度,避免低质量姿态导致生成内容扭曲。 **区域损失放大策略**:针对姿态置信度较低的区域(如手部、面部细节),专门放大损失函数中的对应权重,显著减少图像畸变和伪影,提升关键部位的生成质量。 **渐进式潜在融合**:为了突破视频长度限制,采用逐段生成的策略,并通过潜在空间渐进融合保证相邻片段间的平滑过渡,同时控制计算资源消耗,实现任意长度的长视频生成。

适用场景