LucidDreamer

这是一个能从文本生成3D场景的AI工具,它利用扩散模型“做梦”再“对齐”,创造出细节丰富、不受场景类型限制的高斯飞溅3D模型。

Github 🆓 免费 🔓 开源
✨ 无域限制,任意文本生成3D场景✨ 做梦-对齐双步骤保证多视图一致✨ 基于高斯飞溅,细节极其丰富✨ 支持细粒度文本控制场景内容✨ 定量指标领先RGBD2和COLMAP
🌐 访问官网 →

产品概述

LucidDreamer是一个创新的3D场景生成管道,它打破了传统方法对特定领域扫描数据的依赖,通过两个交替步骤——“做梦”和“对齐”,从任意文本提示生成高质量、多视图一致的3D场景。首先,它利用现有大规模扩散模型生成多视图图像,并将点云作为几何参考进行修复和深度估计,从而构建出新的点云;然后,通过对齐算法将这些新点无缝整合到原有3D场景中,最终优化为高细节的高斯飞溅表示。

核心优势

与以往只能在特定领域(如室内或室外)工作的3D生成模型不同,LucidDreamer没有任何域限制,可以从任意文本提示生成如风景、物体、抽象场景等多样化内容。这得益于它直接调用Stable Diffusion等预训练生成模型的强大能力,并通过点云投影和对齐机制保证了生成内容的多视图一致性。 此外,LucidDreamer生成的3D场景以高斯飞溅形式呈现,细节极其丰富,远超传统RGBD或COLMAP重建方法。在定量评估中,它在CLIP-Score、CLIP-IQA(质量、色彩、清晰度)等指标上均表现优异。用户还可以通过连续文本提示实现细粒度控制,逐步调整场景内容。

适用场景