产品概述
StoryMem是一个基于扩散模型的多镜头长视频生成工具,由字节跳动和南洋理工大学联合开源。它解决了现有单镜头视频生成模型在制作多镜头故事时角色形象和画面风格不一致的痛点。通过在Wan2.2模型基础上添加记忆处理机制,StoryMem能够生成40到60秒、包含8到12个镜头的连续视频,且角色外貌和场景风格从头到尾保持一致。用户只需输入故事脚本或利用现成的模板,即可快速产出电影感十足的短片。
核心优势
StoryMem的核心创新在于它的“视觉记忆库”。生成时,系统先创建第一个镜头作为记忆起点,之后每个新镜头都会参考之前的记忆内容,并动态更新记忆库。记忆库最多保留10张关键帧,先用CLIP按语义相似度筛选,再用HPSv3挑选视觉质量高的帧,自动剔除劣质画面,从而保证连贯性和画质。它提供了三种扩展生成方式:MI2V利用第一帧图像使转场更平滑,MM2V参考前五帧的动作让运动更自然,MR2V则允许用户上传参考图来固定主角面貌。相比现有方法,StoryMem在人物一致性上提升了29%,同时保持了原模型的高画质和提示词贴合度。
适用场景
- **营销广告**:输入脚本快速生成多个动态分镜,支持A/B测试不同创意。
- **影视预制作**:将文字故事板直接转化为可视画面,降低前期概念设计和沟通成本。
- **短视频/独立创作**:没有技术门槛也能制作1分钟类似电影的短片,适合内容创作者。
- **教育与企业培训**:历史重现、科学讲解、产品演示等场景可一键生成视频,提升教学和演示效果。