产品概述
Story-Iter 是 UCSC-VLAA 提出的一种长故事可视化解决方案,旨在根据叙事文本生成连贯的图像序列,支持多达 100 帧的长故事场景。与传统的自回归方法不同,Story-Iter 采用外部迭代机制——在扩散模型内部的去噪步骤之外,增加额外的迭代循环,通过不断整合前一轮生成的所有参考图像来逐步优化每一帧的质量。该框架无需额外训练,即插即用到现有 Stable Diffusion 等扩散模型中,大幅降低了使用门槛。
核心优势
- **免训练与即插即用**:Story-Iter 的全局参考交叉注意力(GRCA)模块无需微调或训练,可直接嵌入预训练的扩散模型,简化部署流程,节省硬件和时间资源。
- **强语义一致性**:通过全局嵌入建模所有参考帧,GRCA 模块在图像生成过程中聚合所有参考图像的信息流,有效维持长序列中角色、场景和风格的一致性,减少因时间推移导致的视觉漂移。
- **高效迭代优化**:采用初始化生成 + 多轮精炼的范式,每轮迭代将上一轮所有图像作为参考,并配合文本约束逐步改进细粒度交互。通常 3-5 轮迭代即可显著提升画面质量,兼顾效率与效果。
适用场景
- **漫画/绘本生成**:根据长篇故事文本自动生成连贯的漫画页面或儿童绘本。
- **动画预可视化**:为动画制作提供故事板级别的视觉预览,辅助导演确认镜头节奏。
- **电影故事板**:快速生成分镜草图,便于摄影师和导演沟通创意。
- **广告创意与游戏过场**:生成长序列的产品宣传视觉故事或游戏剧情连续的视觉叙事。