StoryMem

StoryMem是字节跳动和南洋理工大学开源的AI多镜头长视频生成工具,通过视觉记忆库让多个镜头间角色和风格保持连贯。

Github 🆓 免费 🔓 开源
✨ 多镜头长视频生成✨ 角色和风格高度一致✨ 基于Wan2.2模型✨ 开源免费使用✨ 支持自定义主角
🌐 访问官网 →

产品概述

StoryMem是一个基于扩散模型的多镜头长视频生成工具,由字节跳动和南洋理工大学联合开源。它解决了现有单镜头视频生成模型在制作多镜头故事时角色形象和画面风格不一致的痛点。通过在Wan2.2模型基础上添加记忆处理机制,StoryMem能够生成40到60秒、包含8到12个镜头的连续视频,且角色外貌和场景风格从头到尾保持一致。用户只需输入故事脚本或利用现成的模板,即可快速产出电影感十足的短片。

核心优势

StoryMem的核心创新在于它的“视觉记忆库”。生成时,系统先创建第一个镜头作为记忆起点,之后每个新镜头都会参考之前的记忆内容,并动态更新记忆库。记忆库最多保留10张关键帧,先用CLIP按语义相似度筛选,再用HPSv3挑选视觉质量高的帧,自动剔除劣质画面,从而保证连贯性和画质。它提供了三种扩展生成方式:MI2V利用第一帧图像使转场更平滑,MM2V参考前五帧的动作让运动更自然,MR2V则允许用户上传参考图来固定主角面貌。相比现有方法,StoryMem在人物一致性上提升了29%,同时保持了原模型的高画质和提示词贴合度。

适用场景