产品概述
MimicMotion 是一个基于扩散模型的可控视频生成框架,由腾讯与上海交通大学联合提出。它能够根据用户提供的参考图像和任意动作序列(如姿态骨架),生成细节丰富、时序连贯的高质量人体动作视频。与阿里通义舞王等同类工具相比,MimicMotion 在视频长度、动作控制精度和画面保真度上都有显著提升,并且支持面部特征和唇形同步,因此不仅能做跳舞视频,还能用于数字人创作。
核心优势
**置信感知姿态引导**:系统会对输入的姿态估计结果进行置信度评分,高置信区域在训练和推理中赋予更大权重,从而自适应调整姿态控制强度,避免低质量姿态导致生成内容扭曲。
**区域损失放大策略**:针对姿态置信度较低的区域(如手部、面部细节),专门放大损失函数中的对应权重,显著减少图像畸变和伪影,提升关键部位的生成质量。
**渐进式潜在融合**:为了突破视频长度限制,采用逐段生成的策略,并通过潜在空间渐进融合保证相邻片段间的平滑过渡,同时控制计算资源消耗,实现任意长度的长视频生成。
适用场景
- 一键生成跳舞视频:输入静态人物照片和舞蹈动作序列,输出自然流畅的跳舞短视频。
- 数字人/虚拟主播制作:利用面部与唇形同步能力,驱动静态图像说话或唱歌。
- 影视特效与内容创作:快速生成角色动作预览或替换素材,降低传统动捕成本。
- 运动分析与姿态可视化:结合姿态估计结果,生成可视化引导视频辅助训练。